Aller au contenu principal

Grands modèles de langage (LLM)

info

Aperçu

Cette fonctionnalité est en aperçu public.

Ces notebooks affinent et post-entraînent des grands modèles de langage (LLM) sur Runtime AI. Ils couvrent les méthodes d'efficacité des parameter, telles que l'adaptation de bas rang (LoRA) et l'affinement supervisé complet sur des bibliothèques telles que TRL, Unsloth, Axolotl et LLM Foundry. Pour des exemples d'inférence par batch, voir Inférence par batch.

Didacticiel

Description

Affinement supervisé (complet) de Qwen3-4B

Affinement complet des poids de Qwen3-4B sur un seul GPU H100 avec TRL, en utilisant la précision mixte BF16 et le gradient checkpointing.

Affinement supervisé (LoRA) de Llama-3.2-3B

Effectuez l’affinement LoRA de Llama-3.2-3B sur un seul GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 20B

Affinement LoRA de GPT-OSS 20B sur 8 GPU H100 avec TRL et parallélisme de données distribué.

Affinement supervisé (complet) de Llama-3.2-1B

Effectuez l'affinement complet des poids de Llama-3.2-1B sur 8 GPU H100 avec TRL et DeepSpeed ZeRO Stage 3.

Affinement supervisé (LoRA) d'Olmo3 7B

Affinement LoRA d'Olmo3 7B sur plusieurs GPU avec la bibliothèque Axolotl.

Affinement supervisé (LoRA) de Qwen2-0,5B

Affinez Qwen2-0.5B avec LoRA sur plusieurs processeurs graphiques (GPU) grâce aux noyaux Liger pour un entraînement optimisé pour la mémoire.

Affinement supervisé de Llama-3.2-3B sur multi-GPU

Affinement LoRA de Llama-3.2-3B sur plusieurs GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 120B

Affinement LoRA de GPT-OSS 120B sur 8 GPU H100 avec TRL, en utilisant DDP et FSDP.

Entraînement de transformers sur plusieurs GPU

Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU.

Didacticiel

Description

Affinement supervisé (complet) de Qwen3-4B

Affinement complet des poids de Qwen3-4B sur un seul GPU H100 avec TRL, en utilisant la précision mixte BF16 et le gradient checkpointing.

Affinement supervisé (LoRA) de Llama-3.2-3B

Effectuez l’affinement LoRA de Llama-3.2-3B sur un seul GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 20B

Affinement LoRA de GPT-OSS 20B sur 8 GPU H100 avec TRL et parallélisme de données distribué.

Affinement supervisé (complet) de Llama-3.2-1B

Effectuez l'affinement complet des poids de Llama-3.2-1B sur 8 GPU H100 avec TRL et DeepSpeed ZeRO Stage 3.

Affinement supervisé (LoRA) d'Olmo3 7B

Affinement LoRA d'Olmo3 7B sur plusieurs GPU avec la bibliothèque Axolotl.

Affinement supervisé (LoRA) de Qwen2-0,5B

Affinez Qwen2-0.5B avec LoRA sur plusieurs processeurs graphiques (GPU) grâce aux noyaux Liger pour un entraînement optimisé pour la mémoire.

Affinement supervisé de Llama-3.2-3B sur multi-GPU

Affinement LoRA de Llama-3.2-3B sur plusieurs GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 120B

Affinement LoRA de GPT-OSS 120B sur 8 GPU H100 avec TRL, en utilisant DDP et FSDP.

Entraînement de transformers sur plusieurs GPU

Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU.

Démo vidéo

Cette vidéo présente l’ affinement supervisé (LoRA) de Llama-3.2-3B exemple de notebook en détail (12 minutes).

Sur cette page