Aller au contenu principal

Grands modèles de langage (LLM)

info

Aperçu

Cette fonctionnalité est en aperçu public.

Ces notebooks affinent et post-entraînent des grands modèles de langage (LLM) sur Runtime AI. Ils couvrent les méthodes d'efficacité des parameter, telles que l'adaptation de bas rang (LoRA) et l'affinement supervisé complet sur des bibliothèques telles que TRL, Unsloth, Axolotl et LLM Foundry. Pour des exemples d'inférence par batch, voir Inférence par batch.

Didacticiel

Description

Apprentissage par renforcement de Gemma4-2B

Effectuez un post-entraînement de Gemma4-2B avec l’optimisation par politique relative au groupe (GRPO) et l’adaptation de bas rang (LoRA) sur un seul GPU H100 à l’aide d’Unsloth.

Affinement supervisé (complet) de Qwen3-4B

Affinement complet des poids de Qwen3-4B sur un seul GPU H100 avec TRL, en utilisant la précision mixte BF16 et le gradient checkpointing.

Affinement supervisé (LoRA) de Llama-3.2-3B

Effectuez l’affinement LoRA de Llama-3.2-3B sur un seul GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 20B

Affinement LoRA de GPT-OSS 20B sur 8 GPU H100 avec TRL et parallélisme de données distribué.

Affinement supervisé (complet) de Llama-3.2-1B

Effectuez l'affinement complet des poids de Llama-3.2-1B sur 8 GPU H100 avec TRL et DeepSpeed ZeRO Stage 3.

Affinement supervisé (LoRA) d'Olmo3 7B

Affinement LoRA d'Olmo3 7B sur plusieurs GPU avec la bibliothèque Axolotl.

Supervised affinement (Full) and serving of Qwen3.5-0.8B

Affinez Qwen3.5-0.8B sur un seul GPU H100 avec TRL, puis servez-le derrière un endpoint vLLM Model Serving.

Affinement supervisé de Llama-3.2-3B sur multi-GPU

Affinement LoRA de Llama-3.2-3B sur plusieurs GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 120B

Affinement LoRA de GPT-OSS 120B sur 8 GPU H100 avec TRL, en utilisant DDP et FSDP.

Entraînement de transformers sur plusieurs GPU

Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU.

Didacticiel

Description

Apprentissage par renforcement de Gemma4-2B

Effectuez un post-entraînement de Gemma4-2B avec l’optimisation par politique relative au groupe (GRPO) et l’adaptation de bas rang (LoRA) sur un seul GPU H100 à l’aide d’Unsloth.

Affinement supervisé (complet) de Qwen3-4B

Affinement complet des poids de Qwen3-4B sur un seul GPU H100 avec TRL, en utilisant la précision mixte BF16 et le gradient checkpointing.

Affinement supervisé (LoRA) de Llama-3.2-3B

Effectuez l’affinement LoRA de Llama-3.2-3B sur un seul GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 20B

Affinement LoRA de GPT-OSS 20B sur 8 GPU H100 avec TRL et parallélisme de données distribué.

Affinement supervisé (complet) de Llama-3.2-1B

Effectuez l'affinement complet des poids de Llama-3.2-1B sur 8 GPU H100 avec TRL et DeepSpeed ZeRO Stage 3.

Affinement supervisé (LoRA) d'Olmo3 7B

Affinement LoRA d'Olmo3 7B sur plusieurs GPU avec la bibliothèque Axolotl.

Supervised affinement (Full) and serving of Qwen3.5-0.8B

Affinez Qwen3.5-0.8B sur un seul GPU H100 avec TRL, puis servez-le derrière un endpoint vLLM Model Serving.

Affinement supervisé de Llama-3.2-3B sur multi-GPU

Affinement LoRA de Llama-3.2-3B sur plusieurs GPU avec la bibliothèque Unsloth.

Affinement supervisé (LoRA) de GPT-OSS 120B

Affinement LoRA de GPT-OSS 120B sur 8 GPU H100 avec TRL, en utilisant DDP et FSDP.

Entraînement de transformers sur plusieurs GPU

Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU.

Démo vidéo​

Cette vidéo présente l’ affinement supervisé (LoRA) de Llama-3.2-3B exemple de notebook en détail (12 minutes).

Sur cette page