Configurer le compute classique pour Lakeflow Jobs
Les Jobs classiques vous obligent à créer et configurer des ressources de compute classiques qui répondent aux besoins de vos scénarios de Transformations de données.
Databricks recommande le compute serverless pour la plupart des charges de travail de Job. Le compute serverless gère toute l'infrastructure et élimine le besoin d'une configuration de compute spécifique. Voir Exécutez vos Lakeflow Jobs avec le compute serverless pour les workflows.
Si votre charge de travail n'est pas prise en charge sur serverless, utilisez les bonnes pratiques générales en matière de compute classique décrites dans Bonnes pratiques de configuration de compute classique, et passez en revue les instructions spécifiques aux jobs sur cette page.
Les workflows Structured Streaming ont des recommandations de configuration spécifiques. Consultez Considérations relatives à la production pour Structured Streaming.
Utilisez le compute de jobs, pas le compute multifonction
Databricks déconseille d'utiliser le compute polyvalent pour les jobs pour les raisons suivantes :
- Databricks facture le compute multifonction à un tarif différent de celui du compute des Job.
- Le compute des Jobs se termine automatiquement une fois l'exécution d'un Job terminée. Le compute polyvalent prend en charge l'arrêt automatique, qui est lié à l'inactivité plutôt qu'à la fin d'une exécution de Job.
- Le compute multifonction est souvent partagé entre les équipes d'utilisateurs. Les jobs planifiés sur du compute multifonction ont souvent une latence accrue en raison de la concurrence pour les ressources de compute.
- De nombreuses recommandations pour optimiser la configuration de compute des Job ne sont pas appropriées pour le type de query ad hoc et de charges de travail interactives exécutées sur du compute polyvalent.
Exceptions limitées
Voici des cas d'utilisation dans lesquels vous pourriez choisir d'utiliser le compute universel pour les Jobs :
- Vous développez ou testez de manière itérative de nouveaux Jobs. Les temps de start pour le compute des Jobs peuvent rendre le développement itératif fastidieux. Le compute polyvalent vous permet d'appliquer des modifications et d'exécuter votre job rapidement.
- Vous avez des Jobs de courte durée qui doivent être exécutés fréquemment ou selon un planning spécifique. Aucun temps de start-up n'est associé au calcul multifonction en cours d'exécution. Tenez compte des coûts associés au temps d'inactivité si vous utilisez ce modèle.
Le compute Serverless pour les Jobs est le substitut recommandé pour la plupart des types de tâches que vous pourriez envisager d'exécuter avec le compute multifonction.
Utilisez le mode d'accès standard
Databricks recommande d'utiliser le mode d'accès standard pour les jobs. Voir les modes d'accès.
Lorsque vous créez un nouveau job dans l'interface utilisateur, le mode d'accès du compute est default Auto , sauf si une stratégie de cluster ou une configuration de Workspace impose un mode d'accès différent. Certaines charges de travail ne sont pas compatibles avec le mode d'accès standard. Consultez les exigences et limitations standard de compute.
Si votre Job échoue avec une erreur de compatibilité de mode d'accès standard, et que vous disposez de l’autorisation **Peut gérer** ou **Est propriétaire** sur le Job, et que la politique de cluster et les autorisations de compute du Job permettent de modifier le mode d'accès, modifiez la configuration du cluster du Job pour utiliser le mode d’accès **Dédié**.
Politiques de compute spécifiques aux jobs
Databricks recommande aux administrateurs de Workspace de définir des politiques de compute pour les Jobs et d'appliquer ces politiques à tous les utilisateurs qui configurent des Jobs.
Databricks fournit une politique par default configurée pour les Jobs. Les administrateurs peuvent mettre cette politique à la disposition des autres utilisateurs du Workspace. Voir Compute de Job.