Aller au contenu principal

Aide-mémoire sur la planification des Jobs de production

Cet article vise à fournir des conseils clairs et assumés pour la planification des Jobs de production. L'utilisation de bonnes pratiques peut aider à réduire les coûts, améliorer les performances et renforcer la sécurité.

Bonne pratique

Impact

Documents

Utilisez le compute serverless pour les jobs.

Coût : les jobs Serverless ne nécessitent aucune configuration de cluster. Databricks gère automatiquement le provisionnement et la mise à l’échelle.

Utilisez Lakeflow Jobs pour l’orchestration chaque fois que possible

Coût : Il n’est pas nécessaire d’utiliser des outils externes pour orchestrer si vous orchestrez uniquement des charges de travail sur Databricks.

Utilisez des Service Principal au lieu de comptes d'utilisateur pour exécuter des Jobs de production.

Sécurité : Si des Jobs sont détenus par des utilisateurs individuels, lorsque ces utilisateurs quittent l'organisation, ces Jobs peuvent cesser de fonctionner.

Pour le compute classique : utilisez des clusters de jobs pour les workflows automatisés.

Coût : les clusters de tâches sont facturés à des tarifs inférieurs à ceux des clusters interactifs.

Pour le compute classique : redémarrez les clusters de longue durée.

Sécurité : Redémarrez les clusters pour profiter des correctifs et des corrections de bugs de Databricks Runtime.

Pour le compute classique : utilisez la dernière version LTS de Databricks Runtime

Performances et coûts : Databricks améliore constamment Databricks Runtime en matière de convivialité, de performances et de sécurité.

Pour le compute classique : ne stockez pas les données de production dans la racine DBFS.

Sécurité : lorsque les données sont stockées dans la racine DBFS, tous les utilisateurs peuvent y accéder.

Bonne pratique

Impact

Documents

Utilisez le compute serverless pour les jobs.

Coût : les jobs Serverless ne nécessitent aucune configuration de cluster. Databricks gère automatiquement le provisionnement et la mise à l’échelle.

Utilisez Lakeflow Jobs pour l’orchestration chaque fois que possible

Coût : Il n’est pas nécessaire d’utiliser des outils externes pour orchestrer si vous orchestrez uniquement des charges de travail sur Databricks.

Utilisez des Service Principal au lieu de comptes d'utilisateur pour exécuter des Jobs de production.

Sécurité : Si des Jobs sont détenus par des utilisateurs individuels, lorsque ces utilisateurs quittent l'organisation, ces Jobs peuvent cesser de fonctionner.

Pour le compute classique : utilisez des clusters de jobs pour les workflows automatisés.

Coût : les clusters de tâches sont facturés à des tarifs inférieurs à ceux des clusters interactifs.

Pour le compute classique : redémarrez les clusters de longue durée.

Sécurité : Redémarrez les clusters pour profiter des correctifs et des corrections de bugs de Databricks Runtime.

Pour le compute classique : utilisez la dernière version LTS de Databricks Runtime

Performances et coûts : Databricks améliore constamment Databricks Runtime en matière de convivialité, de performances et de sécurité.

Pour le compute classique : ne stockez pas les données de production dans la racine DBFS.

Sécurité : lorsque les données sont stockées dans la racine DBFS, tous les utilisateurs peuvent y accéder.