Aller au contenu principal

Grands modèles de langage (LLM)

info

Aperçu

Cette fonctionnalité est en aperçu public.

Ces notebooks exécutent l'inférence et l'affinement de grands modèles de langage (LLM) sur AI Runtime. Ils couvrent l'inférence par batch avec Ray Data et vLLM, les méthodes efficaces en termes de paramètres comme l'adaptation de bas rang (LoRA), et l'affinement supervisé complet via des bibliothèques incluant TRL, Unsloth, Axolotl et LLM Foundry.

Didacticiel

Description

Inférence par batch Qwen2.5-32B avec Ray Data et vLLM

Exécutez une inférence multilingue par batch avec huit réplicas vLLM persistants de Qwen2.5-32B-Instruct sur 8 GPU H100 et enregistrez les résultats dans Unity Catalog.

Affiner le modèle Qwen3-4B.

Affiner en poids complet le modèle Qwen3-4B sur un seul GPU H100 à l'aide de l'apprentissage par renforcement de Transformer (TRL), avec une précision mixte BF16 et le point de contrôle du gradient pour un entraînement économe en mémoire.

Affiner Llama-3.2-3B avec Unsloth

Affiner Llama-3.2-3B à l'aide de la bibliothèque Unsloth.

Affiner GPT-OSS 20B

Affinez le modèle gpt-oss-20b d'OpenAI sur 8 GPU H100 en utilisant le parallélisme des données distribué et LoRA pour un affinement efficace des parameter.

Affinement supervisé à l’aide de DeepSpeed et TRL

Utilisez l'API Python Serverless GPU pour exécuter l'affinement supervisé (SFT) à l'aide de la bibliothèque TRL avec l'optimisation DeepSpeed ZeRO Stage 3.

Affinement LoRA à l'aide d'Axolotl

Utilisez l'API Python GPU Serverless pour ajuster LoRA finement un modèle Olmo3 7B en utilisant la bibliothèque Axolotl.

Réglage fin distribué Qwen2-0.5B

Affiner le modèle Qwen2-0,5B à l’aide de LoRA et Liger Kernels pour un entraînement distribué efficace en mémoire avec réduction des paramètres.

Réglage fin distribué de Llama-3.2-3B avec Unsloth

Affinez Llama-3.2-3B en utilisant un entraînement distribué sur plusieurs GPUs avec la bibliothèque Unsloth pour un entraînement optimisé et économe en parameter.

Affiner Llama 3.1 8B avec LLM Foundry

Affinez le modèle Llama 3.1 8B à l'aide de Mosaic LLM Foundry avec des stratégies d'entraînement distribué et l'évaluation des modèles.

Affiner GPT-OSS 120B avec DDP et FSDP

Ajustez finement le modèle GPT-OSS 120B d’OpenAI à l’aide d’un affinement supervisé sur des GPU H100 avec les stratégies d’entraînement distribué DDP et FSDP.

Entraînement distribué avec PyTorch FSDP

Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU.

Didacticiel

Description

Inférence par batch Qwen2.5-32B avec Ray Data et vLLM

Exécutez une inférence multilingue par batch avec huit réplicas vLLM persistants de Qwen2.5-32B-Instruct sur 8 GPU H100 et enregistrez les résultats dans Unity Catalog.

Affiner le modèle Qwen3-4B.

Affiner en poids complet le modèle Qwen3-4B sur un seul GPU H100 à l'aide de l'apprentissage par renforcement de Transformer (TRL), avec une précision mixte BF16 et le point de contrôle du gradient pour un entraînement économe en mémoire.

Affiner Llama-3.2-3B avec Unsloth

Affiner Llama-3.2-3B à l'aide de la bibliothèque Unsloth.

Affiner GPT-OSS 20B

Affinez le modèle gpt-oss-20b d'OpenAI sur 8 GPU H100 en utilisant le parallélisme des données distribué et LoRA pour un affinement efficace des parameter.

Affinement supervisé à l’aide de DeepSpeed et TRL

Utilisez l'API Python Serverless GPU pour exécuter l'affinement supervisé (SFT) à l'aide de la bibliothèque TRL avec l'optimisation DeepSpeed ZeRO Stage 3.

Affinement LoRA à l'aide d'Axolotl

Utilisez l'API Python GPU Serverless pour ajuster LoRA finement un modèle Olmo3 7B en utilisant la bibliothèque Axolotl.

Réglage fin distribué Qwen2-0.5B

Affiner le modèle Qwen2-0,5B à l’aide de LoRA et Liger Kernels pour un entraînement distribué efficace en mémoire avec réduction des paramètres.

Réglage fin distribué de Llama-3.2-3B avec Unsloth

Affinez Llama-3.2-3B en utilisant un entraînement distribué sur plusieurs GPUs avec la bibliothèque Unsloth pour un entraînement optimisé et économe en parameter.

Affiner Llama 3.1 8B avec LLM Foundry

Affinez le modèle Llama 3.1 8B à l'aide de Mosaic LLM Foundry avec des stratégies d'entraînement distribué et l'évaluation des modèles.

Affiner GPT-OSS 120B avec DDP et FSDP

Ajustez finement le modèle GPT-OSS 120B d’OpenAI à l’aide d’un affinement supervisé sur des GPU H100 avec les stratégies d’entraînement distribué DDP et FSDP.

Entraînement distribué avec PyTorch FSDP

Entraînez les modèles Transformer à l'aide de PyTorch Fully Sharded Data Parallel (FSDP) pour répartir les paramètres de modèle sur plusieurs GPU.

Démo vidéo

Cette vidéo présente en détail l'exemple de Notebook Fine-tune Llama-3.2-3B with Unsloth (12 minutes).

Sur cette page