Aller au contenu principal

groupe de commandesclusters

remarque

L'utilisation de Databricks CLI est soumise à la licence Databricks et à la politique de confidentialité Databricks, y compris toutes les dispositions relatives aux données d'utilisation.

Le groupe de commandes clusters au sein de l'interface CLI Databricks vous permet de créer, start, modifier, lister, arrêter et supprimer des clusters.

Un cluster Databricks est un ensemble de ressources de compute et de configurations sur lesquelles vous exécutez des charges de travail de Data Engineering, de Data Science et d'analytique de données, telles que des pipelines ETL de production, de l'analytique en streaming, de l'analytique ad hoc et du Machine Learning. Consultez Présentation du compute classique.

important

Databricks conserve les informations de configuration des clusters arrêtés pendant 30 jours. Pour conserver la configuration d'un cluster polyvalent même après qu'il a été arrêté pendant plus de 30 jours, un administrateur peut pin un cluster à la liste des clusters.

databricks clusters change-owner

Modifiez le propriétaire du cluster. Vous devez être administrateur et le cluster doit être arrêté pour effectuer cette opération. L'ID d'application du Service Principal peut être fourni comme argument à owner_username.

databricks clusters change-owner CLUSTER_ID OWNER_USERNAME [flags]

Arguments

CLUSTER_ID

L'ID du cluster.

OWNER_USERNAME

Nouveau propriétaire du cluster_id après ce RPC.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

Indicateurs globaux

Créer des clusters Databricks

Créez un nouveau cluster. Cette commande acquiert de nouvelles instances auprès du fournisseur cloud, si nécessaire. La création de cluster prend généralement de 5 à 10 minutes. Cette commande est asynchrone ; le cluster_id renvoyé peut être utilisé pour interroger l'état du cluster. Lorsque cette commande renvoie, le cluster est à l'état EN ATTENTE. Le cluster est utilisable une fois qu’il entre en état RUNNING. Databricks pourrait ne pas être en mesure d'acquérir certains des nœuds demandés, en raison de limitations du fournisseur cloud (limites de compte, prix spot, etc.) ou de problèmes réseau transitoires.

Si Databricks acquiert au moins 85 % des nœuds à la demande demandés, la création du cluster réussira. Sinon, le cluster s'arrête avec un message d'erreur informatif.

Plutôt que de créer la définition JSON du cluster à partir de zéro, Databricks recommande de remplir l'interface utilisateur de création de compute, puis de copier la définition JSON générée à partir de l'interface utilisateur.

databricks clusters create SPARK_VERSION [flags]

Arguments

SPARK_VERSION

La version Spark du cluster, par exemple : 13.3.x-scala2.12. Une liste des versions Spark disponibles peut être récupérée à l'aide de l'API Lister les versions Spark disponibles.

Options

--apply-policy-default-values

Lorsque défini sur vrai, les valeurs fixes et par default de la politique sont utilisées pour les champs omis.

--autotermination-minutes int

Arrête automatiquement le cluster après cette durée d'inactivité en minutes.

--cluster-name string

Nom du cluster demandé par l'utilisateur.

--data-security-mode DataSecurityMode

Le mode de sécurité des données détermine quel modèle de gouvernance des données utiliser lors de l'accès aux données depuis un cluster. Valeurs prises en charge : DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_DEDICATED, DATA_SECURITY_MODE_STANDARD, LEGACY_PASSTHROUGH, LEGACY_SINGLE_USER, LEGACY_SINGLE_USER_STANDARD, LEGACY_TABLE_ACL, NONE, SINGLE_USER, USER_ISOLATION

--driver-instance-pool-id string

ID facultatif du pool d’instances auquel appartient le driver du cluster.

--driver-node-type-id string

Le type de nœud du Driver Spark.

--enable-elastic-disk

Dimensionnement automatique du stockage local : lorsqu’il est activé, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses Worker Spark sont à court d’espace disque.

--enable-local-disk-encryption

Faut-il activer LUKS sur les disques locaux des VM des clusters.

--instance-pool-id string

L’ID facultatif du pool d’instances auquel le cluster appartient.

--is-single-node

Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--kind Kind

Le type de compute décrit par cette spécification de compute. Valeurs prises en charge : CLASSIC_PREVIEW

--no-wait

N'attendez pas d'atteindre l'état RUNNING

--node-type-id string

Ce champ encode, au moyen d'une valeur unique, les ressources disponibles pour chacun des nœuds Spark dans ce cluster.

--num-workers int

Nombre de nœuds Worker que ce cluster devrait avoir.

--policy-id string

L'ID de la politique de cluster utilisée pour créer le cluster, le cas échéant.

--runtime-engine RuntimeEngine

Détermine le moteur d'exécution du cluster, soit standard, soit Photon. Valeurs prises en charge : NULL, PHOTON, STANDARD

--single-user-name string

Nom d'utilisateur unique si data_security_mode est SINGLE_USER.

--timeout duration

durée maximale pour atteindre l'état RUNNING (default 20m0s)

--use-ml-runtime

Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.

Indicateurs globaux

supprimer les clusters Databricks

Arrêtez le cluster avec l'ID spécifié. Le cluster est supprimé de manière asynchrone. Une fois l'arrêt terminé, le cluster est à l'état TERMINATED. Si le cluster est déjà à l'état TERMINATING ou TERMINATED, rien ne se passe.

databricks clusters delete CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster à arrêter.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--no-wait

N'attendez pas d'atteindre l'état TERMINATED

--timeout duration

Durée maximale pour atteindre l'état TERMINATED (default 20m0s)

Indicateurs globaux

databricks clusters edit

Mettez à jour la configuration d'un cluster afin de correspondre aux attributs et à la taille fournis. Un cluster peut être mis à jour s’il est à l’état RUNNING ou TERMINATED.

Si un cluster est mis à jour alors qu'il est en état d'exécution, il est redémarré afin que les nouveaux attributs puissent prendre effet.

Si un cluster est mis à jour alors qu'il est en état TERMINATED, il reste TERMINATED. La prochaine fois qu'il est start en utilisant l'API clusters/start, les nouveaux attributs prennent effet. Toute tentative de mise à jour d'un cluster dans un autre état est rejetée avec un code d'erreur INVALID_STATE.

Les clusters créés par le service Databricks Jobs ne peuvent pas être modifiés.

databricks clusters edit CLUSTER_ID SPARK_VERSION [flags]

Arguments

CLUSTER_ID

ID du cluster

SPARK_VERSION

La version Spark du cluster, par exemple : 13.3.x-scala2.12. Une liste des versions Spark disponibles peut être récupérée à l'aide de l'API Lister les versions Spark disponibles.

Options

--apply-policy-default-values

Utilisez les valeurs fixes et default de la politique pour les champs omis.

--autotermination-minutes int

Arrêter automatiquement le cluster après son inactivité pendant ce délai en minutes.

--cluster-name string

Nom du cluster demandé par l'utilisateur.

--data-security-mode DataSecurityMode

Le mode de sécurité des données détermine quel modèle de gouvernance des données utiliser lors de l'accès aux données depuis un cluster. Valeurs prises en charge : DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_DEDICATED``, DATA_SECURITY_MODE_STANDARD, LEGACY_PASSTHROUGH, LEGACY_SINGLE_USER, LEGACY_SINGLE_USER_STANDARD, LEGACY_TABLE_ACL, NONE, SINGLE_USER USER_ISOLATION

--driver-instance-pool-id string

ID facultatif du pool d’instances auquel appartient le driver du cluster.

--driver-node-type-id string

Le type de nœud du Driver Spark.

--enable-elastic-disk

Dimensionnement automatique du stockage local : lorsqu’il est activé, ce cluster acquiert dynamiquement de l’espace disque supplémentaire lorsque ses Worker Spark sont à court d’espace disque.

--enable-local-disk-encryption

Faut-il activer LUKS sur les disques locaux des VM des clusters.

--instance-pool-id string

L’ID facultatif du pool d’instances auquel le cluster appartient.

--is-single-node

Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--kind Kind

Le type de compute décrit par cette spécification de compute. Valeurs prises en charge : CLASSIC_PREVIEW

--no-wait

ne pas attendre d'atteindre l'état RUNNING

--node-type-id string

Ce champ encode, au moyen d'une valeur unique, les ressources disponibles pour chacun des nœuds Spark dans ce cluster.

--num-workers int

Nombre de nœuds Worker que ce cluster devrait avoir.

--policy-id string

L'ID de la politique de cluster utilisée pour créer le cluster, le cas échéant.

--runtime-engine RuntimeEngine

Détermine le moteur d'exécution du cluster, soit standard, soit Photon. Valeurs prises en charge : NULL, PHOTON, STANDARD

--single-user-name string

Nom d’utilisateur unique si data_security_mode est SINGLE_USER.

--timeout duration

durée maximale pour atteindre l'état RUNNING (default 20m0s)

--use-ml-runtime

Ce champ ne peut être utilisé que lorsque le type = CLASSIC_PREVIEW.

Indicateurs globaux

événements des clusters Databricks

Lister les événements concernant l'activité d'un cluster. Cette API est paginée. S'il y a plus d'événements à lire, la réponse inclut tous les parameters nécessaires pour demander la page d'événements suivante.

databricks clusters events CLUSTER_ID [flags]

Arguments

CLUSTER_ID

L'identifiant du cluster pour lequel récupérer les événements.

Options

--end-time int

L’heure de fin en millisecondes d’époque.

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--limit int

Obsolète : utilisez `page_token` en combinaison avec `page_size` à la place.

--offset int

Obsolète : utilisez `page_token` en combinaison avec `page_size` à la place.

--order GetEventsOrder

L'ordre dans lequel les événements doivent être listés. Valeurs supportées : ASC, DESC

--page-size int

Le nombre maximal d'événements à inclure dans une page d'événements.

--page-token string

Utilisez next_page_token ou prev_page_token renvoyés par la requête précédente pour lister la page suivante ou précédente d'événements respectivement.

--start-time int

L'heure de start en millisecondes d'époque.

Indicateurs globaux

databricks clusters get

Obtient les informations d'un cluster étant donné son identifiant. Les clusters peuvent être décrits pendant qu'ils sont en cours d'exécution, ou jusqu'à 60 jours après qu'ils aient été arrêtés.

databricks clusters get CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster au sujet duquel récupérer des informations.

Options

Indicateurs globaux

liste des clusters Databricks

Répertoriez les informations sur tous les clusters pinned et actifs, et tous les clusters terminés au cours des 30 derniers jours. Les clusters terminés avant cette période ne sont pas inclus.

databricks clusters list [flags]

Arguments

Aucun

Options

--cluster-sources []string

Filtrer les clusters par source

--cluster-states []string

Filtrer les clusters par états

--is-pinned

Filtrer les clusters par état pin

--page-size int

Utilisez ce champ pour spécifier le nombre maximal de résultats à renvoyer par le serveur.

--page-token string

Utilisez next_page_token ou prev_page_token renvoyés par la requête précédente pour lister respectivement la page suivante ou précédente de clusters.

--policy-id string

Filtrer les clusters par ID de politique

Indicateurs globaux

databricks clusters list-node-types

Lister les types de nœuds Spark pris en charge. Ces types de nœuds peuvent être utilisés pour lancer un cluster.

databricks clusters list-node-types [flags]

Arguments

Aucun

Options

Indicateurs globaux

databricks clusters list-zones

Répertoriez les zones de disponibilité où les clusters peuvent être créés (par exemple, us-west-2a). Ces zones peuvent être utilisées pour lancer un cluster.

databricks clusters list-zones [flags]

Arguments

Aucun

Options

Indicateurs globaux

Suppression permanente des clusters Databricks

Supprimer définitivement le cluster. Ce cluster est arrêté et les ressources sont supprimées de manière asynchrone.

De plus, les utilisateurs ne verront plus les clusters supprimés définitivement dans la liste des clusters, et les utilisateurs d'API ne pourront plus effectuer d'action sur les clusters supprimés définitivement.

databricks clusters permanent-delete CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster à supprimer.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

Indicateurs globaux

databricks clusters pin

Pin a cluster pour vous assurer que le cluster sera toujours renvoyé par l'API ListClusters. pin un cluster qui est déjà pin n'aura aucun effet. Cette API ne peut être appelée que par les administrateurs du Workspace.

databricks clusters pin CLUSTER_ID [flags]

Arguments

CLUSTER_ID

L'ID du cluster.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

Indicateurs globaux

Redimensionner les clusters Databricks

Redimensionner le cluster pour avoir un nombre souhaité de workers. Cela échouera à moins que le cluster ne soit à l'état D'EXÉCUTION.

databricks clusters resize CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster à redimensionner.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--no-wait

N'attendez pas d'atteindre l'état RUNNING

--num-workers int

Nombre de nœuds Worker que ce cluster devrait avoir.

--timeout duration

La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)

Indicateurs globaux

redémarrage des clusters Databricks

Redémarrez un cluster avec l'ID spécifié. Si le cluster n'est pas actuellement en état de FONCTIONNEMENT, rien ne se passe.

databricks clusters restart CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster à start.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--no-wait

N'attendez pas d'atteindre l'état RUNNING

--restart-user string

Utilisateur qui a redémarré le cluster.

--timeout duration

La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)

Indicateurs globaux

databricks clusters spark-versions

Répertorier les versions de Spark disponibles. Ces versions peuvent être utilisées pour lancer un cluster.

databricks clusters spark-versions [flags]

Arguments

Aucun

Options

Indicateurs globaux

databricks clusters start

Start un cluster arrêté avec l'ID spécifié. Ceci fonctionne de manière similaire à createCluster, à l'exception de : - L'ID de cluster précédent et les attributs sont conservés. - Le cluster start avec la dernière taille de cluster spécifiée. - Si le cluster précédent était un cluster à mise à l'échelle automatique, le cluster actuel start avec le nombre minimal de nœuds. - Si le cluster n'est pas actuellement à l'état TERMINATED, rien ne se passe. - Les clusters lancés pour exécuter un Job ne peuvent pas être start.

databricks clusters start CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster à start.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--no-wait

N'attendez pas d'atteindre l'état RUNNING

--timeout duration

La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)

Indicateurs globaux

Désépingler les clusters Databricks

Désépinglez un cluster pour permettre son retrait éventuel de l'API ListClusters. Désépingler un cluster qui n’est pas pin n’aura aucun effet. Cette API ne peut être appelée que par les administrateurs du Workspace.

databricks clusters unpin CLUSTER_ID [flags]

Arguments

CLUSTER_ID

L'ID du cluster.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

Indicateurs globaux

Mise à jour des clusters Databricks

Mettez à jour la configuration d'un cluster afin qu'elle corresponde à l'ensemble partiel d'attributs et de taille. Indiquez les champs à mettre à jour à l'aide du champ `update_mask` dans le corps de la requête. Un cluster peut être mis à jour s'il est à l'état DÉMARRÉ ou ARRÊTÉ. Si un cluster est mis à jour alors qu'il est à l'état RUNNING, il sera redémarré afin que les nouveaux attributs puissent prendre effet. Si un cluster est mis à jour alors qu'il est à l'état TERMINATED, il restera TERMINATED. Les attributs mis à jour prendront effet la prochaine fois que le cluster sera démarré en utilisant l'API de start des clusters. Les tentatives de mise à jour d'un cluster dans tout autre état seront rejetées avec un code d'erreur INVALID_STATE. Les clusters créés par le service Databricks Jobs ne peuvent pas être mis à jour.

databricks clusters update CLUSTER_ID UPDATE_MASK [flags]

Arguments

CLUSTER_ID

ID du cluster.

UPDATE_MASK

Permet de spécifier quels attributs de cluster et quels champs de taille mettre à jour. Consultez https://google.aip.dev/161 pour plus de détails. Le masque de champ doit être une seule chaîne, avec plusieurs champs séparés par des virgules (sans espaces). Le chemin du champ est relatif à l'objet ressource, en utilisant un point (.) pour naviguer dans les sous-champs (par exemple, author.given_name). La spécification d'éléments dans des champs de séquence ou de carte n'est pas autorisée, car seul l'ensemble du champ de collection peut être spécifié. Les noms de champ doivent correspondre exactement aux noms de champ de ressource. Un masque de champ de _ indique un remplacement complet. Il est recommandé de toujours lister explicitement les champs mis à jour et d'éviter d'utiliser les caractères génériques _, car cela peut entraîner des résultats inattendus si l'API change à l'avenir.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

--no-wait

N'attendez pas d'atteindre l'état RUNNING

--timeout duration

La durée maximale pour atteindre l'état EN COURS D'EXÉCUTION (default 20m0s)

Indicateurs globaux

databricks clusters get-permission-levels

Obtenir les niveaux d'autorisation des clusters.

databricks clusters get-permission-levels CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster pour lequel obtenir ou gérer des autorisations.

Options

Indicateurs globaux

databricks clusters get-permissions

Obtenir les autorisations du cluster. Les clusters peuvent hériter des autorisations de leur objet racine.

databricks clusters get-permissions CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster pour lequel obtenir ou gérer des autorisations.

Options

Indicateurs globaux

databricks clusters set-permissions

Définissez les autorisations du cluster, en remplaçant les autorisations existantes si elles existent. Supprime toutes les autorisations directes si aucune n'est spécifiée. Les objets peuvent hériter des autorisations de leur objet racine.

databricks clusters set-permissions CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster pour lequel obtenir ou gérer des autorisations.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

Indicateurs globaux

databricks clusters mettre à jour les autorisations

Mettre à jour les autorisations sur un cluster. Les clusters peuvent hériter des autorisations de leur objet racine.

databricks clusters update-permissions CLUSTER_ID [flags]

Arguments

CLUSTER_ID

Le cluster pour lequel obtenir ou gérer des autorisations.

Options

--json JSON

La chaîne JSON en ligne ou le @path vers le fichier JSON avec le corps de la requête

Indicateurs globaux

Drapeaux globaux

--debug

Activer ou non la journalisation de débogage.

-h ou --help

Afficher l'aide de Databricks CLI ou du groupe de commandes associé ou de la commande associée.

--log-file chaîne

Une chaîne représentant le fichier dans lequel écrire les logs de sortie. Si cet indicateur n'est pas spécifié, la default est d'écrire les logs de sortie dans stderr.

--log-format Format

Le type de format de log, text ou json. La valeur par default est text.

--log-level chaîne

Une chaîne représentant le niveau de format du log. S'il n'est pas spécifié, le niveau de format du log est désactivé.

-o, --output Type

Le type de sortie de commande, text ou json. La valeur par default est text.

-p, --profile chaîne

Nom du profil dans le fichier ~/.databrickscfg à utiliser pour exécuter la commande. Si cet indicateur n'est pas spécifié, alors s'il existe, le profil nommé DEFAULT est utilisé.

--progress-format Format

Le format pour afficher les logs de progression : default, append, inplace ou json

-t, --target chaîne

Le cas échéant, la cible de bundle à utiliser