groupe de commandesclusters
L'utilisation de Databricks CLI est soumise à la licence Databricks et à la politique de confidentialité Databricks, y compris toutes les dispositions relatives aux données d'utilisation.
Le groupe de commandes clusters au sein de l'interface CLI Databricks vous permet de créer, start, modifier, lister, arrêter et supprimer des clusters.
Un cluster Databricks est un ensemble de ressources de compute et de configurations sur lesquelles vous exécutez des charges de travail de Data Engineering, de Data Science et d'analytique de données, telles que des pipelines ETL de production, de l'analytique en streaming, de l'analytique ad hoc et du Machine Learning. Consultez Présentation du compute classique.
Databricks conserve les informations de configuration des clusters arrêtés pendant 30 jours. Pour conserver la configuration d'un cluster polyvalent même après qu'il a été arrêté pendant plus de 30 jours, un administrateur peut pin un cluster à la liste des clusters.
databricks clusters change-owner
Modifiez le propriétaire du cluster. Vous devez être administrateur et le cluster doit être arrêté pour effectuer cette opération. L'ID d'application du Service Principal peut être fourni comme argument à owner_username.
databricks clusters change-owner CLUSTER_ID OWNER_USERNAME [flags]
Arguments
CLUSTER_ID
L'ID du cluster.
OWNER_USERNAME
Nouveau propriétaire du cluster_id après ce RPC.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
Créer des clusters Databricks
Créez un nouveau cluster. Cette commande acquiert de nouvelles instances auprès du fournisseur cloud, si nécessaire. La création de cluster prend généralement de 5 à 10 minutes. Cette commande est asynchrone ; le cluster_id renvoyé peut être utilisé pour interroger l'état du cluster. Lorsque cette commande renvoie, le cluster est à l'état EN ATTENTE. Le cluster est utilisable une fois qu’il entre en état RUNNING. Databricks pourrait ne pas être en mesure d'acquérir certains des nœuds demandés, en raison de limitations du fournisseur cloud (limites de compte, prix spot, etc.) ou de problèmes réseau transitoires.
Si Databricks acquiert au moins 85 % des nœuds à la demande demandés, la création du cluster réussira. Sinon, le cluster s'arrête avec un message d'erreur informatif.
Plutôt que de créer la définition JSON du cluster à partir de zéro, Databricks recommande de remplir l'interface utilisateur de création de compute, puis de copier la définition JSON générée à partir de l'interface utilisateur.
databricks clusters create SPARK_VERSION [flags]
Arguments
SPARK_VERSION
La version Spark du cluster, par exemple : 13.3.x-scala2.12. Une liste des versions Spark disponibles peut être récupérée à l'aide de l'API Lister les versions Spark disponibles.
Options
--apply-policy-default-values
Lorsque défini sur vrai, les valeurs fixes et par default de la politique sont utilisées pour les champs omis.
--autotermination-minutes int
Arrête automatiquement le cluster après cette durée d'inactivité en minutes.
--cluster-name string
Nom du cluster demandé par l'utilisateur.
--data-security-mode DataSecurityMode
Le mode de sécurité des données détermine quel modèle de gouvernance des données utiliser lors de l'accès aux données depuis un cluster. Valeurs prises en charge : DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_DEDICATED, DATA_SECURITY_MODE_STANDARD, LEGACY_PASSTHROUGH, LEGACY_SINGLE_USER, LEGACY_SINGLE_USER_STANDARD, LEGACY_TABLE_ACL, NONE, SINGLE_USER, USER_ISOLATION
--driver-instance-pool-id string
ID facultatif du pool d’instances auquel appartient le driver du cluster.
--driver-node-type-id string
Le type de nœud du Driver Spark.
--enable-elastic-disk
Dimensionnement automatique du stockage local : lorsqu’il est activé, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses Worker Spark sont à court d’espace disque.
--enable-local-disk-encryption
Faut-il activer LUKS sur les disques locaux des VM des clusters.
--instance-pool-id string
L’ID facultatif du pool d’instances auquel le cluster appartient.
--is-single-node
Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--kind Kind
Le type de compute décrit par cette spécification de compute. Valeurs prises en charge : CLASSIC_PREVIEW
--no-wait
N'attendez pas d'atteindre l'état RUNNING
--node-type-id string
Ce champ encode, au moyen d'une valeur unique, les ressources disponibles pour chacun des nœuds Spark dans ce cluster.
--num-workers int
Nombre de nœuds Worker que ce cluster devrait avoir.
--policy-id string
L'ID de la politique de cluster utilisée pour créer le cluster, le cas échéant.
--runtime-engine RuntimeEngine
Détermine le moteur d'exécution du cluster, soit standard, soit Photon. Valeurs prises en charge : NULL, PHOTON, STANDARD
--single-user-name string
Nom d'utilisateur unique si data_security_mode est SINGLE_USER.
--timeout duration
durée maximale pour atteindre l'état RUNNING (default 20m0s)
--use-ml-runtime
Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.
supprimer les clusters Databricks
Arrêtez le cluster avec l'ID spécifié. Le cluster est supprimé de manière asynchrone. Une fois l'arrêt terminé, le cluster est à l'état TERMINATED. Si le cluster est déjà à l'état TERMINATING ou TERMINATED, rien ne se passe.
databricks clusters delete CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster à arrêter.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--no-wait
N'attendez pas d'atteindre l'état TERMINATED
--timeout duration
Durée maximale pour atteindre l'état TERMINATED (default 20m0s)
databricks clusters edit
Mettez à jour la configuration d'un cluster afin de correspondre aux attributs et à la taille fournis. Un cluster peut être mis à jour s’il est à l’état RUNNING ou TERMINATED.
Si un cluster est mis à jour alors qu'il est en état d'exécution, il est redémarré afin que les nouveaux attributs puissent prendre effet.
Si un cluster est mis à jour alors qu'il est en état TERMINATED, il reste TERMINATED. La prochaine fois qu'il est start en utilisant l'API clusters/start, les nouveaux attributs prennent effet. Toute tentative de mise à jour d'un cluster dans un autre état est rejetée avec un code d'erreur INVALID_STATE.
Les clusters créés par le service Databricks Jobs ne peuvent pas être modifiés.
databricks clusters edit CLUSTER_ID SPARK_VERSION [flags]
Arguments
CLUSTER_ID
ID du cluster
SPARK_VERSION
La version Spark du cluster, par exemple : 13.3.x-scala2.12. Une liste des versions Spark disponibles peut être récupérée à l'aide de l'API Lister les versions Spark disponibles.
Options
--apply-policy-default-values
Utilisez les valeurs fixes et default de la politique pour les champs omis.
--autotermination-minutes int
Arrêter automatiquement le cluster après son inactivité pendant ce délai en minutes.
--cluster-name string
Nom du cluster demandé par l'utilisateur.
--data-security-mode DataSecurityMode
Le mode de sécurité des données détermine quel modèle de gouvernance des données utiliser lors de l'accès aux données depuis un cluster. Valeurs prises en charge : DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_DEDICATED``, DATA_SECURITY_MODE_STANDARD, LEGACY_PASSTHROUGH, LEGACY_SINGLE_USER, LEGACY_SINGLE_USER_STANDARD, LEGACY_TABLE_ACL, NONE, SINGLE_USER USER_ISOLATION
--driver-instance-pool-id string
ID facultatif du pool d’instances auquel appartient le driver du cluster.
--driver-node-type-id string
Le type de nœud du Driver Spark.
--enable-elastic-disk
Dimensionnement automatique du stockage local : lorsqu’il est activé, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses Worker Spark sont à court d’espace disque.
--enable-local-disk-encryption
Faut-il activer LUKS sur les disques locaux des VM des clusters.
--instance-pool-id string
L’ID facultatif du pool d’instances auquel le cluster appartient.
--is-single-node
Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--kind Kind
Le type de compute décrit par cette spécification de compute. Valeurs prises en charge : CLASSIC_PREVIEW
--no-wait
ne pas attendre d'atteindre l'état RUNNING
--node-type-id string
Ce champ encode, au moyen d'une valeur unique, les ressources disponibles pour chacun des nœuds Spark dans ce cluster.
--num-workers int
Nombre de nœuds Worker que ce cluster devrait avoir.
--policy-id string
L'ID de la politique de cluster utilisée pour créer le cluster, le cas échéant.
--runtime-engine RuntimeEngine
Détermine le moteur d'exécution du cluster, soit standard, soit Photon. Valeurs prises en charge : NULL, PHOTON, STANDARD
--single-user-name string
Nom d’utilisateur unique si data_security_mode est SINGLE_USER.
--timeout duration
durée maximale pour atteindre l'état RUNNING (default 20m0s)
--use-ml-runtime
Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.
événements des clusters Databricks
Lister les événements concernant l'activité d'un cluster. Cette API est paginée. S'il y a plus d'événements à lire, la réponse inclut tous les parameters nécessaires pour demander la page d'événements suivante.
databricks clusters events CLUSTER_ID [flags]
Arguments
CLUSTER_ID
L'identifiant du cluster pour lequel récupérer les événements.
Options
--end-time int
L’heure de fin en millisecondes d’époque.
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--limit int
Obsolète : utilisez `page_token` en combinaison avec `page_size` à la place.
--offset int
Obsolète : utilisez `page_token` en combinaison avec `page_size` à la place.
--order GetEventsOrder
L'ordre dans lequel les événements doivent être listés. Valeurs supportées : ASC, DESC
--page-size int
Le nombre maximal d'événements à inclure dans une page d'événements.
--page-token string
Utilisez next_page_token ou prev_page_token renvoyés par la requête précédente pour lister la page suivante ou précédente d'événements respectivement.
--start-time int
L'heure de start en millisecondes d'époque.
databricks clusters get
Obtient les informations d'un cluster étant donné son identifiant. Les clusters peuvent être décrits pendant qu'ils sont en cours d'exécution, ou jusqu'à 60 jours après qu'ils aient été arrêtés.
databricks clusters get CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster au sujet duquel récupérer des informations.
Options
liste des clusters Databricks
Répertoriez les informations sur tous les clusters pinned et actifs, et tous les clusters terminés au cours des 30 derniers jours. Les clusters terminés avant cette période ne sont pas inclus.
databricks clusters list [flags]
Arguments
Aucun
Options
--cluster-sources []string
Filtrer les clusters par source
--cluster-states []string
Filtrer les clusters par états
--is-pinned
Filtrer les clusters par état pin
--page-size int
Utilisez ce champ pour spécifier le nombre maximal de résultats à renvoyer par le serveur.
--page-token string
Utilisez next_page_token ou prev_page_token renvoyés par la requête précédente pour lister respectivement la page suivante ou précédente de clusters.
--policy-id string
Filtrer les clusters par ID de politique
databricks clusters list-node-types
Lister les types de nœuds Spark pris en charge. Ces types de nœuds peuvent être utilisés pour lancer un cluster.
databricks clusters list-node-types [flags]
Arguments
Aucun
Options
databricks clusters list-zones
Répertoriez les zones de disponibilité où les clusters peuvent être créés (par exemple, us-west-2a). Ces zones peuvent être utilisées pour lancer un cluster.
databricks clusters list-zones [flags]
Arguments
Aucun
Options
Suppression permanente des clusters Databricks
Supprimer définitivement le cluster. Ce cluster est arrêté et les ressources sont supprimées de manière asynchrone.
De plus, les utilisateurs ne verront plus les clusters supprimés définitivement dans la liste des clusters, et les utilisateurs d'API ne pourront plus effectuer d'action sur les clusters supprimés définitivement.
databricks clusters permanent-delete CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster à supprimer.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
databricks clusters pin
Pin a cluster pour vous assurer que le cluster sera toujours renvoyé par l'API ListClusters. pin un cluster qui est déjà pin n'aura aucun effet. Cette API ne peut être appelée que par les administrateurs du Workspace.
databricks clusters pin CLUSTER_ID [flags]
Arguments
CLUSTER_ID
L'ID du cluster.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
Redimensionner les clusters Databricks
Redimensionner le cluster pour avoir un nombre souhaité de workers. Cela échouera à moins que le cluster ne soit à l'état D'EXÉCUTION.
databricks clusters resize CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster à redimensionner.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--no-wait
N'attendez pas d'atteindre l'état RUNNING
--num-workers int
Nombre de nœuds Worker que ce cluster devrait avoir.
--timeout duration
La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)
redémarrage des clusters Databricks
Redémarrez un cluster avec l'ID spécifié. Si le cluster n'est pas actuellement en état de FONCTIONNEMENT, rien ne se passe.
databricks clusters restart CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster à start.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--no-wait
N'attendez pas d'atteindre l'état RUNNING
--restart-user string
Utilisateur qui a redémarré le cluster.
--timeout duration
La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)
databricks clusters spark-versions
Répertorier les versions de Spark disponibles. Ces versions peuvent être utilisées pour lancer un cluster.
databricks clusters spark-versions [flags]
Arguments
Aucun
Options
databricks clusters start
Start un cluster arrêté avec l'ID spécifié. Ceci fonctionne de manière similaire à createCluster, à l'exception de : - L'ID de cluster précédent et les attributs sont conservés. - Le cluster start avec la dernière taille de cluster spécifiée. - Si le cluster précédent était un cluster à mise à l'échelle automatique, le cluster actuel start avec le nombre minimal de nœuds. - Si le cluster n'est pas actuellement à l'état TERMINATED, rien ne se passe. - Les clusters lancés pour exécuter un Job ne peuvent pas être start.
databricks clusters start CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster à start.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--no-wait
N'attendez pas d'atteindre l'état RUNNING
--timeout duration
La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)
Désépingler les clusters Databricks
Désépinglez un cluster pour permettre son retrait éventuel de l'API ListClusters. Désépingler un cluster qui n’est pas pin n’aura aucun effet. Cette API ne peut être appelée que par les administrateurs du Workspace.
databricks clusters unpin CLUSTER_ID [flags]
Arguments
CLUSTER_ID
L'ID du cluster.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
Mise à jour des clusters Databricks
Mettez à jour la configuration d'un cluster afin qu'elle corresponde à l'ensemble partiel d'attributs et de taille. Indiquez les champs à mettre à jour à l'aide du champ `update_mask` dans le corps de la requête. Un cluster peut être mis à jour s'il est à l'état DÉMARRÉ ou ARRÊTÉ. Si un cluster est mis à jour alors qu'il est à l'état RUNNING, il sera redémarré afin que les nouveaux attributs puissent prendre effet. Si un cluster est mis à jour alors qu'il est à l'état TERMINATED, il restera TERMINATED. Les attributs mis à jour prendront effet la prochaine fois que le cluster sera démarré en utilisant l'API de start des clusters. Les tentatives de mise à jour d'un cluster dans tout autre état seront rejetées avec un code d'erreur INVALID_STATE. Les clusters créés par le service Databricks Jobs ne peuvent pas être mis à jour.
databricks clusters update CLUSTER_ID UPDATE_MASK [flags]
Arguments
CLUSTER_ID
ID du cluster.
UPDATE_MASK
Permet de spécifier quels attributs de cluster et quels champs de taille mettre à jour. Consultez https://google.aip.dev/161 pour plus de détails. Le masque de champ doit être une seule chaîne, avec plusieurs champs séparés par des virgules (sans espaces). Le chemin du champ est relatif à l'objet ressource, en utilisant un point (.) pour naviguer dans les sous-champs (par exemple, author.given_name). La spécification d'éléments dans des champs de séquence ou de carte n'est pas autorisée, car seul l'ensemble du champ de collection peut être spécifié. Les noms de champ doivent correspondre exactement aux noms de champ de ressource. Un masque de champ de _ indique un remplacement complet. Il est recommandé de toujours lister explicitement les champs mis à jour et d'éviter d'utiliser les caractères génériques _, car cela peut entraîner des résultats inattendus si l'API change à l'avenir.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
--no-wait
N'attendez pas d'atteindre l'état RUNNING
--timeout duration
La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)
databricks clusters get-permission-levels
Obtenir les niveaux d'autorisation des clusters.
databricks clusters get-permission-levels CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster pour lequel obtenir ou gérer des autorisations.
Options
databricks clusters get-permissions
Obtenir les autorisations du cluster. Les clusters peuvent hériter des autorisations de leur objet racine.
databricks clusters get-permissions CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster pour lequel obtenir ou gérer des autorisations.
Options
databricks clusters set-permissions
Définissez les autorisations du cluster, en remplaçant les autorisations existantes si elles existent. Supprime toutes les autorisations directes si aucune n'est spécifiée. Les objets peuvent hériter des autorisations de leur objet racine.
databricks clusters set-permissions CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster pour lequel obtenir ou gérer des autorisations.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
databricks clusters mettre à jour les autorisations
Mettre à jour les autorisations sur un cluster. Les clusters peuvent hériter des autorisations de leur objet racine.
databricks clusters update-permissions CLUSTER_ID [flags]
Arguments
CLUSTER_ID
Le cluster pour lequel obtenir ou gérer des autorisations.
Options
--json JSON
La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête
Drapeaux globaux
--debug
Activer ou non la journalisation de débogage.
-h ou --help
Afficher l'aide de Databricks CLI ou du groupe de commandes associé ou de la commande associée.
--log-file chaîne
Une chaîne représentant le fichier dans lequel écrire les logs de sortie. Si cet indicateur n'est pas spécifié, la default est d'écrire les logs de sortie dans stderr.
--log-format Format
Le type de format de log, text ou json. La valeur par default est text.
--log-level chaîne
Une chaîne représentant le niveau de format du log. S'il n'est pas spécifié, le niveau de format du log est désactivé.
-o, --output Type
Le type de sortie de commande, text ou json. La valeur par default est text.
-p, --profile chaîne
Nom du profil dans le fichier ~/.databrickscfg à utiliser pour exécuter la commande. Si cet indicateur n'est pas spécifié, alors s'il existe, le profil nommé DEFAULT est utilisé.
--progress-format Format
Le format pour afficher les logs de progression : default, append, inplace ou json
-t, --target chaîne
Le cas échéant, la cible de bundle à utiliser