Utilisation de base pour la CLI Databricks
L'utilisation de Databricks CLI est soumise à la licence Databricks et à la politique de confidentialité Databricks, y compris toutes les dispositions relatives aux données d'utilisation.
Cette page vous montre comment répertorier les groupes de commandes et les commandes de Databricks CLI, afficher l'aide de Databricks CLI et travailler avec la sortie de Databricks CLI. Voir Databricks CLI.
Pour installer et configurer l'authentification de la CLI Databricks, consultez le tutoriel sur la CLI Databricks.
Lister les commandes CLI disponibles
Pour répertorier les groupes de commandes CLI disponibles, utilisez l’option --help ou -h, par exemple :
databricks -h
Pour lister les commandes de n'importe quel groupe de commandes, utilisez l'option --help ou -h. Par exemple, pour lister les clusters commandes :
databricks clusters -h
Afficher l’aide de la commande CLI
Pour afficher les informations d'utilisation d’une commande, utilisez l’option --help ou -h avec la commande. Par exemple, pour afficher l'aide de la commande clusters list :
databricks clusters list -h
La référence des commandes est également disponible. Consultez commandes CLI Databricks.
Exécuter une commande
Des informations complètes sur l'utilisation et la syntaxe des commandes individuelles se trouvent dans l'aide en ligne de commande et la référence, mais les commandes Databricks CLI sont généralement conformes à la syntaxe suivante :
databricks <command-group> <command-name> <subcommand-name> [command-argument-value1] [--<flag1-name> <flag1-value>]
Toutes les commandes n'ont pas de sous-commandes supplémentaires. Des indicateurs globaux sont disponibles, et certaines commandes ont des indicateurs supplémentaires. Par exemple, la commande suivante affiche les clusters disponibles, à l'aide d'un indicateur spécifique à la commande :
databricks clusters list --can-use-client JOBS
Vous pouvez exécuter des commandes CLI Databricks au sein d'un workspace Databricks à l'aide du terminal web. Le terminal web du Workspace peut être utilisé par de nombreux utilisateurs sur un seul compute et ne vous oblige pas à configurer l'authentification. Consultez Exécuter des commandes Shell dans le terminal web Databricks.
Exemple : Créez un Job Databricks
L'exemple suivant utilise la CLI pour créer un Job Databricks. Ce Job contient une seule tâche de Job. Cette tâche exécute le Notebook Databricks spécifié. Ce Notebook dépend d'une version spécifique du package PyPI nommé wheel. Pour exécuter cette tâche, le job crée temporairement un cluster de jobs qui exporte une variable d'environnement nommée PYSPARK_PYTHON. Une fois le job exécuté, le cluster est arrêté.
databricks jobs create --json '{
"name": "My hello notebook job",
"tasks": [
{
"task_key": "my_hello_notebook_task",
"notebook_task": {
"notebook_path": "/Workspace/Users/someone@example.com/hello",
"source": "WORKSPACE"
},
"libraries": [
{
"pypi": {
"package": "wheel==0.41.2"
}
}
],
"new_cluster": {
"spark_version": "13.3.x-scala2.12",
"node_type_id": "i3.xlarge",
"num_workers": 1,
"spark_env_vars": {
"PYSPARK_PYTHON": "/databricks/python3/bin/python3"
}
}
}
]
}'
Entrée et sortie JSON
Certaines commandes Databricks CLI ont un indicateur --json ou d'autres options qui acceptent une entrée de chaîne JSON. En outre, certaines commandes génèrent une chaîne JSON.
Formatage de chaînes
Le format des chaînes JSON dépend de votre système d'exploitation :
- Linux or macOS
- Windows
Mettez les paramètres de chaîne JSON entre guillemets doubles et l'ensemble de la charge utile JSON entre guillemets simples. Par exemple :
'{"cluster_id": "1234-567890-abcde123"}'
'["20230323", "Amsterdam"]'
Mettez entre guillemets les paramètres de chaîne JSON et l'intégralité de la charge utile JSON, et faites précéder les guillemets à l'intérieur de la charge utile JSON d'une barre oblique inversée (\). Par exemple :
"{\"cluster_id\": \"1234-567890-abcde123\"}"
"[\"20230323\", \"Amsterdam\"]"
Définir les champs dans une chaîne JSON
L'indicateur --json de nombreuses commandes vous permet de définir des champs d'objet qui pourraient ne pas être disponibles en tant que commandes ou options CLI. Par exemple, l'appel suivant ajoute un utilisateur avec l'ID 9ddddddd-1eee-4eee-a666-8fff7c111111 au groupe avec l'ID 7eeeeeee-9ccc-4aaa-b777-1aaaaaaaaaa:
- Linux or macOS
- Windows
databricks account groups patch 7eeeeeee-9ccc-4aaa-b777-1aaa2eeeee6f --json '{
"schemas": ["urn:ietf:params:scim:api:messages:2.0:PatchOp"],
"Operations": [
{
"op": "add",
"path": "members",
"value": [
{
"value": "9ddddddd-1eee-4eee-a666-8fff7c111111"
}
]
}
]
}'
databricks account groups patch 7eeeeeee-9ccc-4aaa-b777-1aaa2eeeee6f --json "{
\"schemas\": [\"urn:ietf:params:scim:api:messages:2.0:PatchOp\"],
\"Operations\": [
{
\"op\": \"add\",
\"path\": \"members\",
\"value\": [
{
\"value\": \"9ddddddd-1eee-4eee-a666-8fff7c111111\"
}
]
}
]
}"
Filtrer la sortie JSON avec jq
Pour les commandes Databricks CLI qui génèrent du JSON, vous pouvez utiliser le processeur de ligne de commande jq pour filtrer la sortie. Par exemple, pour n'afficher que le nom d'affichage d'un cluster Databricks avec l'ID de cluster spécifié :
databricks clusters get 1234-567890-abcde123 | jq -r .cluster_name
My-11.3-LTS-Cluster
Vous pouvez installer jq sur macOS à l'aide de Homebrew avec brew install jq ou sur Windows à l'aide de Chocolatey avec choco install jq. Pour plus d'informations sur jq, consultez le manuel jq.
Configuration du serveur proxy
Pour acheminer les requêtes et les réponses du CLI Databricks via un serveur proxy, définissez la variable d’environnement HTTPS_PROXY sur la machine où le CLI Databricks est installé à l’URL du serveur proxy.
Pour définir les variables d’environnement, consultez la documentation de votre système d’exploitation.