Grands modèles de langage (LLM)
Aperçu
Cette fonctionnalité est en aperçu public.
Ces notebooks affinent et post-entraînent des grands modèles de langage (LLM) sur Runtime AI. Ils couvrent les méthodes d'efficacité des parameter, telles que l'adaptation de bas rang (LoRA) et l'affinement supervisé complet sur des bibliothèques telles que TRL, Unsloth, Axolotl et LLM Foundry. Pour des exemples d'inférence par batch, voir Inférence par batch.
Didacticiel | Description |
|---|---|
Affinement complet des poids de Qwen3-4B sur un seul GPU H100 avec TRL, en utilisant la précision mixte BF16 et le gradient checkpointing. | |
Effectuez l’affinement LoRA de Llama-3.2-3B sur un seul GPU avec la bibliothèque Unsloth. | |
Affinement LoRA de GPT-OSS 20B sur 8 GPU H100 avec TRL et parallélisme de données distribué. | |
Effectuez l'affinement complet des poids de Llama-3.2-1B sur 8 GPU H100 avec TRL et DeepSpeed ZeRO Stage 3. | |
Affinement LoRA d'Olmo3 7B sur plusieurs GPU avec la bibliothèque Axolotl. | |
Affinez Qwen2-0.5B avec LoRA sur plusieurs processeurs graphiques (GPU) grâce aux noyaux Liger pour un entraînement optimisé pour la mémoire. | |
Affinement LoRA de Llama-3.2-3B sur plusieurs GPU avec la bibliothèque Unsloth. | |
Affinement LoRA de GPT-OSS 120B sur 8 GPU H100 avec TRL, en utilisant DDP et FSDP. | |
Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU. |
Démo vidéo
Cette vidéo présente l’ affinement supervisé (LoRA) de Llama-3.2-3B exemple de notebook en détail (12 minutes).