Aide-mémoire sur la planification des Jobs de production
Cet article vise à fournir des conseils clairs et assumés pour la planification des Jobs de production. L'utilisation de bonnes pratiques peut aider à réduire les coûts, améliorer les performances et renforcer la sécurité.
Bonne pratique | Impact | Documents |
|---|---|---|
Utilisez le compute serverless pour les jobs. | Coût : les jobs Serverless ne nécessitent aucune configuration de cluster. Databricks gère automatiquement le provisionnement et la mise à l’échelle. | |
Utilisez Lakeflow Jobs pour l’orchestration chaque fois que possible | Coût : Il n’est pas nécessaire d’utiliser des outils externes pour orchestrer si vous orchestrez uniquement des charges de travail sur Databricks. | |
Utilisez des Service Principal au lieu de comptes d'utilisateur pour exécuter des Jobs de production. | Sécurité : Si des Jobs sont détenus par des utilisateurs individuels, lorsque ces utilisateurs quittent l'organisation, ces Jobs peuvent cesser de fonctionner. | |
Pour le compute classique : utilisez des clusters de jobs pour les workflows automatisés. | Coût : les clusters de tâches sont facturés à des tarifs inférieurs à ceux des clusters interactifs. | |
Pour le compute classique : redémarrez les clusters de longue durée. | Sécurité : Redémarrez les clusters pour profiter des correctifs et des corrections de bugs de Databricks Runtime. | |
Pour le compute classique : utilisez la dernière version LTS de Databricks Runtime | Performances et coûts : Databricks améliore constamment Databricks Runtime en matière de convivialité, de performances et de sécurité. | |
Pour le compute classique : ne stockez pas les données de production dans la racine DBFS. | Sécurité : lorsque les données sont stockées dans la racine DBFS, tous les utilisateurs peuvent y accéder. |