Référence de la configuration du Pool
Cet article décrit les paramètres disponibles lors de la création d'un pool à l'aide de l'interface utilisateur. Pour savoir comment utiliser la CLI Databricks pour créer un pool, consultez les commandes de la CLI Databricks. Pour savoir comment utiliser l'API REST pour créer un pool, consultez l'API des pools d'instances.
Si votre charge de travail prend en charge le calcul serverless, Databricks recommande d'utiliser le calcul serverless au lieu des pools pour tirer parti d'un compute évolutif et toujours disponible. Voir Se connecter au compute Serverless.
Taille du Pool
Lorsque vous créez un Pool, afin de contrôler sa taille, vous pouvez définir le nombre minimum d'instances inactives et la capacité maximale. L'arrêt automatique des instances inactives dans les pools n'est pas pris en charge.
Nombre minimal d'instances inactives
Le nombre minimal d'instances que le Pool maintient inactives. Ces instances ne se terminent pas, quels que soient les paramètres d'arrêt automatique. Si un cluster consomme des instances inactives du pool, Databricks provisionne des instances supplémentaires pour maintenir le minimum.
Types d'instances
Un pool se compose d'instances inactives maintenues prêtes pour de nouveaux clusters et d'instances utilisées par les clusters en cours d'exécution. Toutes ces instances sont du même type de fournisseur d'instances, sélectionné lors de la création d'un Pool.
Le type d'instance d'un Pool ne peut pas être modifié. Les clusters attachés à un pool utilisent le même type d'instance pour les nœuds driver et worker. Différentes familles de types d'instances conviennent à différents cas d'utilisation, tels que les charges de travail gourmandes en mémoire ou en compute.
Databricks fournit toujours un avis d'obsolescence d'un an avant de cesser la prise en charge d'un type d'instance.
Version préchargée de Databricks Runtime
Vous pouvez accélérer le démarrage des clusters en sélectionnant une version de Databricks Runtime à charger sur les instances inactives du pool. Si un utilisateur sélectionne ce runtime lorsqu'il crée un cluster soutenu par le pool, ce cluster se lancera encore plus rapidement qu'un cluster soutenu par le pool qui n'utilise pas une version préchargée de Databricks Runtime.
Définir cette option sur None ralentit les lancements de cluster, car cela provoque le download à la demande de la version de Databricks Runtime vers les instances inactives du Pool. Lorsque le cluster libère les instances du Pool, la version de Databricks Runtime reste mise en cache sur ces instances. La prochaine opération de création de cluster qui utilise la même version de Databricks Runtime pourrait bénéficier de ce comportement de mise en cache, mais ce n'est pas garanti.
Image Docker préchargée
Les images Docker sont prises en charge avec les pools si vous utilisez l'API de pools d'instances pour créer le pool. Consultez Utiliser Databricks Container Services avec un pool d'instances pour plus d'informations.
Tags de Pool
Les tags de pool vous permettent de surveiller le coût des ressources cloud utilisées par les différents groupes de votre organisation.
Les graphiques d'utilisation facturable Databricks dans la console de compte peuvent agréger l'utilisation par balises individuelles. Les rapports CSV d'utilisation facturable download depuis la même page incluent également des tags default et personnalisés. Les tags se propagent également aux étiquettes GKE et GCE.
Par commodité, Databricks applique trois tags default à chaque Pool : Vendor,
DatabricksInstancePoolId et DatabricksInstancePoolCreatorId. Vous pouvez également ajouter des balises personnalisées lorsque vous créez un pool. Vous pouvez ajouter jusqu’à 43 tags personnalisés.
Tags personnalisés
Pour ajouter des tags supplémentaires au Pool, accédez à l'tab **Tabs** au bas de la page **Créer un Pool**. Cliquez sur le bouton + Add , puis saisissez la paire clé-valeur.
Les clusters basés sur un Pool héritent des tags default et personnalisés de la configuration du Pool. Pour des informations détaillées sur la façon dont les tags de Pool et les Cluster Tags fonctionnent ensemble, consultez Utiliser des tags pour attribuer et suivre l'utilisation.
Configurez la zone de disponibilité
Vous pouvez configurer la zone de disponibilité du Pool lorsque vous créez le Pool à l'aide du menu déroulant Zone de disponibilité . Ceci est un champ facultatif. Si elle n'est pas définie, la Pool utilise une zone default.
Vous ne pouvez pas mettre à jour la zone de disponibilité d'un pool après le lancement du pool. Si vous souhaitez que votre pool utilise une zone de disponibilité différente, vous devez créer un nouveau pool.
La zone de disponibilité doit se trouver dans la même région que votre Workspace Databricks.
Configurations zonales en conflit
Si la ressource de compute que vous attachez à un Pool d'instances est configurée pour utiliser une zone de disponibilité différente de celle du Pool d'instances, les configurations de la ressource de compute sont ignorées et elle hérite de la configuration zonale du Pool d'instances.
Le driver de la ressource compute hérite de la préférence zonale ou multi-zonale du pool d'instances du driver, et tout exécuteur hérite de la préférence zonale ou multi-zonale du pool d'instances de l'exécuteur.