Grands modèles de langage (LLM)
Aperçu
Cette fonctionnalité est en aperçu public.
Ces notebooks affinent et post-entraînent des grands modèles de langage (LLM) sur Runtime AI. Ils couvrent les méthodes d'efficacité des parameter, telles que l'adaptation de bas rang (LoRA) et l'affinement supervisé complet sur des bibliothèques telles que TRL, Unsloth, Axolotl et LLM Foundry. Pour des exemples d'inférence par batch, voir Inférence par batch.
Didacticiel | Description |
|---|---|
Effectuez un post-entraînement de Gemma4-2B avec l’optimisation par politique relative au groupe (GRPO) et l’adaptation de bas rang (LoRA) sur un seul GPU H100 à l’aide d’Unsloth. | |
Affinement complet des poids de Qwen3-4B sur un seul GPU H100 avec TRL, en utilisant la précision mixte BF16 et le gradient checkpointing. | |
Effectuez l’affinement LoRA de Llama-3.2-3B sur un seul GPU avec la bibliothèque Unsloth. | |
Affinement LoRA de GPT-OSS 20B sur 8 GPU H100 avec TRL et parallélisme de données distribué. | |
Effectuez l'affinement complet des poids de Llama-3.2-1B sur 8 GPU H100 avec TRL et DeepSpeed ZeRO Stage 3. | |
Affinement LoRA d'Olmo3 7B sur plusieurs GPU avec la bibliothèque Axolotl. | |
Affinez Qwen3.5-0.8B sur un seul GPU H100 avec TRL, puis servez-le derrière un endpoint vLLM Model Serving. | |
Affinement LoRA de Llama-3.2-3B sur plusieurs GPU avec la bibliothèque Unsloth. | |
Affinement LoRA de GPT-OSS 120B sur 8 GPU H100 avec TRL, en utilisant DDP et FSDP. | |
Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU. |
Démo vidéo
Cette vidéo présente l’ affinement supervisé (LoRA) de Llama-3.2-3B exemple de notebook en détail (12 minutes).