Exemples de CLI AI Runtime
info
Aperçu
Cette fonctionnalité est en aperçu public.
Les exemples suivants sont des charges de travail complètes, de bout en bout, que vous soumettez depuis la air CLI
avec air run -f train.yaml. Chacun présente un réel schéma multi-GPU sur les GPU H100, y compris
le YAML de la charge de travail, les commandes de démarrage et le code. Start with the
démarrage rapide si vous n'avez jamais soumis d'exécution auparavant.
-
- Affinement de LLM multi-nœuds avec FSDP
- Affinement supervisé de Llama-3.1-8B sur 16 GPU H100 (2 nœuds) à l'aide de
torchrunet de PyTorch Fully Sharded Data Parallel (FSDP). Logs vers MLflow et points de contrôle vers un volume Unity Catalog.
-
- Formation distribuée avec Ray Train
- Affinement de modèles distribué en parallèle avec le
TorchTrainerde Ray Train sur 8 GPU H100 sur un seul nœud, avec un Worker par GPU.
-
- Inférence par batch avec Ray Data et vLLM
- Inférence de LLM batch hors ligne avec Ray Data et vLLM sur 8 GPU H100 sur un seul nœud, exécutant une réplique vLLM par GPU et écrivant les résultats dans un volume Unity Catalog au format Parquet.