Guide de démarrage rapide de la CLI Python héritée pour AI Runtime
Cette documentation a été retirée et ne sera peut-être pas mise à jour.
La CLI air basée sur Python, installée avec le package databricks-air, est désormais obsolète et n'est plus maintenue activement.
Utilisez la CLI Databricks pour les nouvelles charges de travail. Consultez Utiliser la CLI Databricks avec AI Runtime.
Soumettez votre premier job d’entraînement avec AI Runtime CLI en trois étapes : rédigez une configuration train.yaml, exécutez-la avec air run, puis inspectez l’exécution. Avant de commencer, installez la CLI et configurez l’authentification.
Étape 1 : rédiger la configuration YAML
Créez train.yaml décrivant la charge de travail. La configuration minimale requiert un nom d'expérimentation, une spécification de compute et une commande. La commande ci-dessous s'exécute sans aucun code local, de sorte que vous pouvez soumettre votre première exécution immédiatement :
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"
Exécuter votre propre code
Pour exécuter un script d'entraînement local, ajoutez un bloc environment qui répertorie vos dépendances Python et un bloc code_source qui effectue l'upload de votre code local. Placez votre script à côté de train.yaml:
my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py
Cette configuration installe les dépendances répertoriées, effectue l’upload du répertoire actuel (root_path: .) et exécute train.py sur un seul GPU A10. $CODE_SOURCE_PATH correspond à l'emplacement du code upload sur le nœud distant. Databricks recommande d'utiliser ceci plutôt que de coder en dur un chemin d'accès. environment.version sélectionne la version de l'environnement GPU Serverless et est facultatif (la valeur par default est '4'). Pour consulter toutes les versions disponibles, voir Environment versions.
Pour obtenir la référence complète des champs, consultez la référence Workload YAML pour l’ancienne CLI Python legacy.
Étape 2 : soumettre l'exécution
Soumettre la charge de travail :
air run --file train.yaml
La CLI upload votre code local (si vous avez configuré un code_source), soumet le job et affiche un identifiant d’exécution. Utilisez cet identifiant pour inspecter, surveiller et annuler l’exécution dans les commandes ultérieures.
La soumission crée une exécution dans l’Expérimentation MLflow nommée dans experiment_name (une expérimentation peut contenir de nombreuses exécutions). Cette exécution capture les métriques, les paramètres, les artefacts et les Logs de la charge de travail, tous consultables dans l’interface utilisateur MLflow du Workspace. Logs sont également disponibles en dehors de MLflow : Stream-les vers votre terminal ou un fichier, ou download-les ultérieurement avec air logs (consultez l’étape 3).
Pour afficher les Logs jusqu'à la fin, ajoutez --watch:
air run --file train.yaml --watch
Étape 3 : inspecter l'exécution
Vérifier l’état :
air get run <run-id>
The output includes clickable links to the run's MLflow experiment and MLflow run in the workspace UI.
Stream ou download les Logs :
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/
Distributed workloads run across multiple nodes. By default, air logs streams from node 0. To view logs from a specific node, pass --node. Use --download-to to write logs to a local directory instead of streaming them.
Lister les exécutions récentes :
air list runs --limit 10
air list runs --active
Annuler une exécution :
air cancel <run-id>
Modèles courants
Remplacez les champs YAML à partir de la ligne de commande :
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120
Valider la configuration sans l'envoyer :
air run --file train.yaml --dry-run
Rendez une soumission réessayable en toute sécurité :
air run --file train.yaml --idempotency-key my-unique-key
Si la même clé a déjà été utilisée, l’exécution existante est renvoyée au lieu d’en créer une nouvelle.