Pular para o conteúdo principal

Modelos de linguagem de grande porte (LLMs)

info

Visualização

Este recurso está em Pré-visualização Pública.

Esses exemplos fazem ajuste fino e pós-treinamento de grandes modelos de linguagem (LLMs) no AI Runtime. Eles abrangem métodos eficientes em termos de parâmetros, como adaptação de baixa classificação (LoRA) e ajuste fino supervisionado completo em bibliotecas como TRL, Unsloth, Axolotl e LLM Foundry. Para ver exemplos de inferência em lotes, consulte Inferência em lotes.

Exemplo

Interface

Descrição

Aprendizado por reforço do Gemma4-2B

Notebook

Faça o pós-treinamento do Gemma4-2B com o Group Relative Policy Optimization (GRPO) e o Low-Rank Adaptation (LoRA) em uma única GPU H100 usando o Unsloth.

Ajuste fino supervisionado (completo) do Qwen3-4B

Notebook

Ajuste fino de peso total de Qwen3-4B em uma única GPU H100 com TRL, usando precisão mista BF16 e verificação de gradiente.

Ajuste fino supervisionado (LoRA) do Llama-3.2-3B

Notebook

Ajuste fino de LoRA em Llama-3.2-3B em uma única GPU com a biblioteca Unsloth.

Supervised Fine-tuning (LoRA) do GPT-OSS 20B

Notebook

LoRA fine-tune GPT-OSS 20B em 8 GPUs H100 com TRL e paralelismo de dados distribuído.

Ajuste Fino Supervisionado (Completo) do Llama-3.2-1B

Notebook

Ajuste fino de peso total do Llama-3.2-1B em 8 GPUs H100 com TRL e DeepSpeed ZeRO Stage 3.

Ajuste fino supervisionado (LoRA) do Olmo3 7B

Notebook

Faça o ajuste fino de LoRA no Olmo3 7B em várias GPUs com a biblioteca Axolotl.

Ajuste fino supervisionado (completo) e serving do Qwen3.5-0.8B

Notebook

Ajuste fino do Qwen3.5-0.8B em uma única GPU H100 com o TRL e, em seguida, disponibilize-o atrás de um endpoint de Model Serving do vLLM.

Ajuste fino supervisionado do Llama-3.2-3B em múltiplas GPUs

Notebook

Ajuste fino de LoRA para Llama-3.2-3B em múltiplas GPUs com a biblioteca Unsloth.

Ajuste fino supervisionado (LoRA) do GPT-OSS 120B

Notebook

Ajuste fino do GPT-OSS 120B com LoRA em 8 GPUs H100 com TRL, usando DDP e FSDP.

Treinamento de transformers em várias GPUs

Notebook

Ensinar modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para distribuir os parâmetros do modelo entre várias GPUs.

Ajuste fino FSDP multinó de Llama 3.1 8B

CLIPE

Faça o ajuste fino supervisionado de Llama 3.1 8B com PyTorch FSDP em dois nós 8x H100, registre a perda de treinamento no MLflow e salve um checkpoint consolidado.

Ajuste fino FSDP2 multinó de Qwen3.8-27B

CLIPE

Faça o ajuste fino supervisionado do Qwen3.8-27B com PyTorch FSDP2 em quatro nós com 8 x H100.

Ajuste fino de todos os pesos de Qwen3-8B para extração de faturas

CLIPE

Ajuste fino de Qwen3-8B para extração de entidades de faturas e recibos com TRL e DeepSpeed ZeRO-3 em um nó com 8 GPUs H100.

Ajuste fino supervisionado do Qwen2.5-3B com o Ray Train

CLIPE

Use o Ray Train para fazer o ajuste fino do Qwen2.5-3B com um worker de paralelismo de dados distribuído para cada GPU em um nó com 8 x H100.

Busca de hiperparâmetros de LoRA para Qwen2.5-0.5B

CLIPE

Use Ray Tune e o algoritmo de redução sucessiva assíncrona (ASHA) para pesquisar configurações de LoRA em quatro GPUs A10 e registrar a melhor configuração no MLflow.

Exemplo

Interface

Descrição

Aprendizado por reforço do Gemma4-2B

Notebook

Faça o pós-treinamento do Gemma4-2B com o Group Relative Policy Optimization (GRPO) e o Low-Rank Adaptation (LoRA) em uma única GPU H100 usando o Unsloth.

Ajuste fino supervisionado (completo) do Qwen3-4B

Notebook

Ajuste fino de peso total de Qwen3-4B em uma única GPU H100 com TRL, usando precisão mista BF16 e verificação de gradiente.

Ajuste fino supervisionado (LoRA) do Llama-3.2-3B

Notebook

Ajuste fino de LoRA em Llama-3.2-3B em uma única GPU com a biblioteca Unsloth.

Supervised Fine-tuning (LoRA) do GPT-OSS 20B

Notebook

LoRA fine-tune GPT-OSS 20B em 8 GPUs H100 com TRL e paralelismo de dados distribuído.

Ajuste Fino Supervisionado (Completo) do Llama-3.2-1B

Notebook

Ajuste fino de peso total do Llama-3.2-1B em 8 GPUs H100 com TRL e DeepSpeed ZeRO Stage 3.

Ajuste fino supervisionado (LoRA) do Olmo3 7B

Notebook

Faça o ajuste fino de LoRA no Olmo3 7B em várias GPUs com a biblioteca Axolotl.

Ajuste fino supervisionado (completo) e serving do Qwen3.5-0.8B

Notebook

Ajuste fino do Qwen3.5-0.8B em uma única GPU H100 com o TRL e, em seguida, disponibilize-o atrás de um endpoint de Model Serving do vLLM.

Ajuste fino supervisionado do Llama-3.2-3B em múltiplas GPUs

Notebook

Ajuste fino de LoRA para Llama-3.2-3B em múltiplas GPUs com a biblioteca Unsloth.

Ajuste fino supervisionado (LoRA) do GPT-OSS 120B

Notebook

Ajuste fino do GPT-OSS 120B com LoRA em 8 GPUs H100 com TRL, usando DDP e FSDP.

Treinamento de transformers em várias GPUs

Notebook

Ensinar modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para distribuir os parâmetros do modelo entre várias GPUs.

Ajuste fino FSDP multinó de Llama 3.1 8B

CLIPE

Faça o ajuste fino supervisionado de Llama 3.1 8B com PyTorch FSDP em dois nós 8x H100, registre a perda de treinamento no MLflow e salve um checkpoint consolidado.

Ajuste fino FSDP2 multinó de Qwen3.8-27B

CLIPE

Faça o ajuste fino supervisionado do Qwen3.8-27B com PyTorch FSDP2 em quatro nós com 8 x H100.

Ajuste fino de todos os pesos de Qwen3-8B para extração de faturas

CLIPE

Ajuste fino de Qwen3-8B para extração de entidades de faturas e recibos com TRL e DeepSpeed ZeRO-3 em um nó com 8 GPUs H100.

Ajuste fino supervisionado do Qwen2.5-3B com o Ray Train

CLIPE

Use o Ray Train para fazer o ajuste fino do Qwen2.5-3B com um worker de paralelismo de dados distribuído para cada GPU em um nó com 8 x H100.

Busca de hiperparâmetros de LoRA para Qwen2.5-0.5B

CLIPE

Use Ray Tune e o algoritmo de redução sucessiva assíncrona (ASHA) para pesquisar configurações de LoRA em quatro GPUs A10 e registrar a melhor configuração no MLflow.

Vídeo demonstrativo​

Este vídeo apresenta o passo a passo do ajuste fino supervisionado (LoRA) do Llama-3.2-3B notebook de exemplo em detalhes (12 minutos).