Aide-mémoire de création de compute
Cet article vise à fournir des conseils clairs et assumés pour la création de compute. En utilisant les types de compute adaptés à votre workflow, vous pouvez améliorer les performances et réduire les coûts.
Bonne pratique | Impact | Documents |
|---|---|---|
Utiliser le compute serverless pour la plupart des charges de travail. | Databricks gère automatiquement le dimensionnement, la mise à l'échelle et l'infrastructure. Aucune configuration de cluster n'est requise. | |
Pour le compute classique : utilisez le mode d'accès standard, sauf si votre fonctionnalité requise n'est pas prise en charge | Le compute avec le mode d'accès standard peut être utilisé par plusieurs utilisateurs avec une isolation des données entre les utilisateurs. | |
Pour le compute classique : commencez par utiliser des types d'instances à usage général si vous débutez avec Databricks. | La sélection du type d'instance approprié pour la charge de travail se traduit par une efficacité accrue. | |
Pour le compute classique : utilisez les types d'instances Graviton s'ils sont disponibles. | Selon AWS, les types d’instance dotés de processeurs Graviton affichent le meilleur rapport prix/performance de tous les types d’instance. | |
Pour le compute classique : utilisez les types d'instance de dernière génération s'il y a suffisamment de disponibilité. | La dernière génération de types d'instances offre les meilleures performances et les dernières fonctionnalités. | |
Pour le compute classique : définissez votre équilibre entre instances à la demande et ponctuelles en fonction de la rapidité d'exécution de votre charge de travail. | Les instances Spot permettent de réduire les coûts, mais peuvent affecter la durée d'exécution globale d'une opération si les instances Spot sont récupérées. | |
Pour le compute classique : choisissez la taille de vos nœuds et le nombre de Worker en fonction des types d'Opérations que votre charge de travail effectue. | Par exemple, si vous vous attendez à de nombreux shuffles, il peut être plus efficace d’utiliser un grand nœud unique au lieu de plusieurs nœuds plus petits. | |
Pour le compute classique : exécutez un vacuum sur un cluster avec mise à l’échelle automatique définie pour 1 à 4 workers, où chaque worker dispose de 8 cœurs. Sélectionnez un driver avec entre 8 et 32 cœurs. Augmentez la taille du driver si vous rencontrez des erreurs de mémoire insuffisante (OOM). | Les instructions vacuum se déroulent en deux phases, dont la seconde est gourmande en driver. Si vous n'utilisez pas le cluster de taille appropriée, l'opération pourrait entraîner un ralentissement et ne pas aboutir. | |
Pour le compute classique : évaluez si votre flux de travail batch bénéficierait de Photon | Photon offre des query plus rapides et réduit votre coût total par workload. |