Modelos de linguagem de grande porte (LLMs)
Visualização
Este recurso está em Pré-visualização Pública.
Esses exemplos fazem ajuste fino e pós-treinamento de grandes modelos de linguagem (LLMs) no AI Runtime. Eles abrangem métodos eficientes em termos de parâmetros, como adaptação de baixa classificação (LoRA) e ajuste fino supervisionado completo em bibliotecas como TRL, Unsloth, Axolotl e LLM Foundry. Para ver exemplos de inferência em lotes, consulte Inferência em lotes.
Exemplo | Interface | Descrição |
|---|---|---|
Notebook | Faça o pós-treinamento do Gemma4-2B com o Group Relative Policy Optimization (GRPO) e o Low-Rank Adaptation (LoRA) em uma única GPU H100 usando o Unsloth. | |
Notebook | Ajuste fino de peso total de Qwen3-4B em uma única GPU H100 com TRL, usando precisão mista BF16 e verificação de gradiente. | |
Notebook | Ajuste fino de LoRA em Llama-3.2-3B em uma única GPU com a biblioteca Unsloth. | |
Notebook | LoRA fine-tune GPT-OSS 20B em 8 GPUs H100 com TRL e paralelismo de dados distribuído. | |
Notebook | Ajuste fino de peso total do Llama-3.2-1B em 8 GPUs H100 com TRL e DeepSpeed ZeRO Stage 3. | |
Notebook | Faça o ajuste fino de LoRA no Olmo3 7B em várias GPUs com a biblioteca Axolotl. | |
Ajuste fino supervisionado (completo) e serving do Qwen3.5-0.8B | Notebook | Ajuste fino do Qwen3.5-0.8B em uma única GPU H100 com o TRL e, em seguida, disponibilize-o atrás de um endpoint de Model Serving do vLLM. |
Ajuste fino supervisionado do Llama-3.2-3B em múltiplas GPUs | Notebook | Ajuste fino de LoRA para Llama-3.2-3B em múltiplas GPUs com a biblioteca Unsloth. |
Notebook | Ajuste fino do GPT-OSS 120B com LoRA em 8 GPUs H100 com TRL, usando DDP e FSDP. | |
Notebook | Ensinar modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para distribuir os parâmetros do modelo entre várias GPUs. | |
CLIPE | Faça o ajuste fino supervisionado de Llama 3.1 8B com PyTorch FSDP em dois nós 8x H100, registre a perda de treinamento no MLflow e salve um checkpoint consolidado. | |
CLIPE | Faça o ajuste fino supervisionado do Qwen3.8-27B com PyTorch FSDP2 em quatro nós com 8 x H100. | |
Ajuste fino de todos os pesos de Qwen3-8B para extração de faturas | CLIPE | Ajuste fino de Qwen3-8B para extração de entidades de faturas e recibos com TRL e DeepSpeed ZeRO-3 em um nó com 8 GPUs H100. |
CLIPE | Use o Ray Train para fazer o ajuste fino do Qwen2.5-3B com um worker de paralelismo de dados distribuído para cada GPU em um nó com 8 x H100. | |
CLIPE | Use Ray Tune e o algoritmo de redução sucessiva assíncrona (ASHA) para pesquisar configurações de LoRA em quatro GPUs A10 e registrar a melhor configuração no MLflow. |
Vídeo demonstrativo
Este vídeo apresenta o passo a passo do ajuste fino supervisionado (LoRA) do Llama-3.2-3B notebook de exemplo em detalhes (12 minutos).