Aller au contenu principal

Utilisation de base pour la CLI Databricks

remarque

L'utilisation de Databricks CLI est soumise à la licence Databricks et à la politique de confidentialité Databricks, y compris toutes les dispositions relatives aux données d'utilisation.

Cette page vous montre comment répertorier les groupes de commandes et les commandes de Databricks CLI, afficher l'aide de Databricks CLI et travailler avec la sortie de Databricks CLI. Voir Databricks CLI.

Pour installer et configurer l'authentification de la CLI Databricks, consultez le tutoriel sur la CLI Databricks.

Lister les commandes CLI disponibles

Pour répertorier les groupes de commandes CLI disponibles, utilisez l’option --help ou -h, par exemple :

Bash
databricks -h

Pour lister les commandes de n'importe quel groupe de commandes, utilisez l'option --help ou -h. Par exemple, pour lister les clusters commandes :

Bash
databricks clusters -h

Afficher l’aide de la commande CLI

Pour afficher les informations d'utilisation d’une commande, utilisez l’option --help ou -h avec la commande. Par exemple, pour afficher l'aide de la commande clusters list :

Bash
databricks clusters list -h

La référence des commandes est également disponible. Consultez commandes CLI Databricks.

Exécuter une commande

Des informations complètes sur l'utilisation et la syntaxe des commandes individuelles se trouvent dans l'aide en ligne de commande et la référence, mais les commandes Databricks CLI sont généralement conformes à la syntaxe suivante :

databricks <command-group> <command-name> <subcommand-name> [command-argument-value1] [--<flag1-name> <flag1-value>]

Toutes les commandes n'ont pas de sous-commandes supplémentaires. Des indicateurs globaux sont disponibles, et certaines commandes ont des indicateurs supplémentaires. Par exemple, la commande suivante affiche les clusters disponibles, à l'aide d'un indicateur spécifique à la commande :

Bash
databricks clusters list --can-use-client JOBS
astuce

Vous pouvez exécuter des commandes CLI Databricks au sein d'un workspace Databricks à l'aide du terminal web. Le terminal web du Workspace peut être utilisé par de nombreux utilisateurs sur un seul compute et ne vous oblige pas à configurer l'authentification. Consultez Exécuter des commandes Shell dans le terminal web Databricks.

Exemple : Créez un Job Databricks

L'exemple suivant utilise la CLI pour créer un Job Databricks. Ce Job contient une seule tâche de Job. Cette tâche exécute le Notebook Databricks spécifié. Ce Notebook dépend d'une version spécifique du package PyPI nommé wheel. Pour exécuter cette tâche, le job crée temporairement un cluster de jobs qui exporte une variable d'environnement nommée PYSPARK_PYTHON. Une fois le job exécuté, le cluster est arrêté.

Bash
databricks jobs create --json '{
"name": "My hello notebook job",
"tasks": [
{
"task_key": "my_hello_notebook_task",
"notebook_task": {
"notebook_path": "/Workspace/Users/someone@example.com/hello",
"source": "WORKSPACE"
},
"libraries": [
{
"pypi": {
"package": "wheel==0.41.2"
}
}
],
"new_cluster": {
"spark_version": "13.3.x-scala2.12",
"node_type_id": "i3.xlarge",
"num_workers": 1,
"spark_env_vars": {
"PYSPARK_PYTHON": "/databricks/python3/bin/python3"
}
}
}
]
}'

Entrée et sortie JSON

Certaines commandes Databricks CLI ont un indicateur --json ou d'autres options qui acceptent une entrée de chaîne JSON. En outre, certaines commandes génèrent une chaîne JSON.

Formatage de chaînes

Le format des chaînes JSON dépend de votre système d'exploitation :

Mettez les paramètres de chaîne JSON entre guillemets doubles et l'ensemble de la charge utile JSON entre guillemets simples. Par exemple :

'{"cluster_id": "1234-567890-abcde123"}'
'["20230323", "Amsterdam"]'

Définir les champs dans une chaîne JSON

L'indicateur --json de nombreuses commandes vous permet de définir des champs d'objet qui pourraient ne pas être disponibles en tant que commandes ou options CLI. Par exemple, l'appel suivant ajoute un utilisateur avec l'ID 9ddddddd-1eee-4eee-a666-8fff7c111111 au groupe avec l'ID 7eeeeeee-9ccc-4aaa-b777-1aaaaaaaaaa:

Bash
databricks account groups patch 7eeeeeee-9ccc-4aaa-b777-1aaa2eeeee6f --json '{
"schemas": ["urn:ietf:params:scim:api:messages:2.0:PatchOp"],
"Operations": [
{
"op": "add",
"path": "members",
"value": [
{
"value": "9ddddddd-1eee-4eee-a666-8fff7c111111"
}
]
}
]
}'

Filtrer la sortie JSON avec jq

Pour les commandes Databricks CLI qui génèrent du JSON, vous pouvez utiliser le processeur de ligne de commande jq pour filtrer la sortie. Par exemple, pour n'afficher que le nom d'affichage d'un cluster Databricks avec l'ID de cluster spécifié :

Bash
databricks clusters get 1234-567890-abcde123 | jq -r .cluster_name
Output
My-11.3-LTS-Cluster

Vous pouvez installer jq sur macOS à l'aide de Homebrew avec brew install jq ou sur Windows à l'aide de Chocolatey avec choco install jq. Pour plus d'informations sur jq, consultez le manuel jq.

Configuration du serveur proxy

Pour acheminer les requêtes et les réponses du CLI Databricks via un serveur proxy, définissez la variable d’environnement HTTPS_PROXY sur la machine où le CLI Databricks est installé à l’URL du serveur proxy.

Pour définir les variables d’environnement, consultez la documentation de votre système d’exploitation.