Grands modèles de langage (LLM)
Aperçu
Cette fonctionnalité est en aperçu public.
Ces notebooks exécutent l'inférence et l'affinement de grands modèles de langage (LLM) sur AI Runtime. Ils couvrent l'inférence par batch avec Ray Data et vLLM, les méthodes efficaces en termes de paramètres comme l'adaptation de bas rang (LoRA), et l'affinement supervisé complet via des bibliothèques incluant TRL, Unsloth, Axolotl et LLM Foundry.
Didacticiel | Description |
|---|---|
Exécutez une inférence multilingue par batch avec huit réplicas vLLM persistants de Qwen2.5-32B-Instruct sur 8 GPU H100 et enregistrez les résultats dans Unity Catalog. | |
Affiner en poids complet le modèle Qwen3-4B sur un seul GPU H100 à l'aide de l'apprentissage par renforcement de Transformer (TRL), avec une précision mixte BF16 et le point de contrôle du gradient pour un entraînement économe en mémoire. | |
Affiner Llama-3.2-3B à l'aide de la bibliothèque Unsloth. | |
Affinez le modèle | |
Utilisez l'API Python Serverless GPU pour exécuter l'affinement supervisé (SFT) à l'aide de la bibliothèque TRL avec l'optimisation DeepSpeed ZeRO Stage 3. | |
Utilisez l'API Python GPU Serverless pour ajuster LoRA finement un modèle Olmo3 7B en utilisant la bibliothèque Axolotl. | |
Affiner le modèle Qwen2-0,5B à l’aide de LoRA et Liger Kernels pour un entraînement distribué efficace en mémoire avec réduction des paramètres. | |
Affinez Llama-3.2-3B en utilisant un entraînement distribué sur plusieurs GPUs avec la bibliothèque Unsloth pour un entraînement optimisé et économe en parameter. | |
Affinez le modèle Llama 3.1 8B à l'aide de Mosaic LLM Foundry avec des stratégies d'entraînement distribué et l'évaluation des modèles. | |
Ajustez finement le modèle GPT-OSS 120B d’OpenAI à l’aide d’un affinement supervisé sur des GPU H100 avec les stratégies d’entraînement distribué DDP et FSDP. | |
Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU. |
Démo vidéo
Cette vidéo présente en détail l'exemple de Notebook Fine-tune Llama-3.2-3B with Unsloth (12 minutes).