Exemples de CLI Databricks pour AI Runtime
info
Aperçu
Cette fonctionnalité est en aperçu public.
Les exemples suivants constituent des workloads complets de bout en bout que vous soumettez depuis la CLI Databricks
avec databricks air run -f <config>.yaml. Chacun comprend le fichier YAML du workload, les éventuels scripts de bootstrap
et l'intégralité du code. Start with the
guide de démarrage rapide si vous n'avez jamais soumis d'exécution auparavant.
-
- Affinement de LLM multi-nœuds avec FSDP
- Affinement supervisé de Llama-3.1-8B sur 16 GPU H100 (2 nœuds) à l'aide de
torchrunet de PyTorch Fully Sharded Data Parallel (FSDP). Logs vers MLflow et points de contrôle vers un volume Unity Catalog.
-
- Ray hello world
- Exemples de travail minimaux pour Ray Core, Ray Train, Ray Data et Ray Tune, incluant le modèle d'amorçage partagé pour exécuter des clusters Ray sur AI Runtime.
-
- Formation distribuée avec Ray Train
- Affinement de modèles distribué en parallèle avec le
TorchTrainerde Ray Train sur 8 GPU H100 sur un seul nœud, avec un Worker par GPU.
-
- Inférence par batch avec Ray Data et vLLM
- Inférence batch LLM hors ligne avec Ray Data et vLLM sur 4 nœuds A10, avec une réplique vLLM exécutée par nœud et écriture des résultats dans un volume Unity Catalog au format Parquet.
-
- Recherche d'hyperparamètres avec Ray Tune
- Recherche d'hyperparamètres LoRA pour Qwen2.5-0.5B avec Ray Tune sur 4 nœuds 1xA10, exécutant un essai par GPU et arrêtant prématurément les essais peu performants avec le planificateur ASHA.