Pular para o conteúdo principal

Modelos de linguagem de grande porte (LLMs)

info

Visualização

Este recurso está em Pré-visualização Pública.

Estes notebooks executam inferência e ajuste fino de grandes modelos de linguagem (LLM) no AI Runtime. Eles cobrem inferência em lote com Ray Data e vLLM, métodos de eficiência de parâmetros como Low-Rank Adaptation (LoRA) e ajuste fino supervisionado completo em bibliotecas, incluindo TRL, Unsloth, Axolotl e LLM Foundry.

Tutorial

Descrição

Inferência em lotes do Qwen2.5-32B com Ray Data e vLLM

Execute inferência multilíngue em lotes com oito réplicas persistentes de vLLM do Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog.

Ajuste fino do modelo Qwen3-4B

Ajuste fino de peso total do modelo Qwen3-4B em uma única GPU H100 usando Aprendizagem por Reforço de Transformer (TRL), com precisão mista BF16 e checkpointing de gradiente para treinamento com eficiência de memória.

Ajuste fino Llama-3.2-3B com Unsloth

Ajuste o Llama-3.2-3B usando a biblioteca Unsloth.

Ajuste fino do GPT-OSS 20B

Otimize o modelo gpt-oss-20b da OpenAI em 8 GPUs H100, usando paralelismo de dados distribuídos e LoRA para otimização eficiente de parâmetros.

Ajuste fino supervisionado usando DeepSpeed e TRL

Utilize a API Python para GPU sem servidor para executar o ajuste fino supervisionado (SFT) usando a biblioteca TRL com a otimização DeepSpeed ZeRO Stage 3.

Ajuste fino do LoRA usando o Axolotl

Utilize a API Python para GPU sem servidor para ajustar um modelo Olmo3 7B usando a biblioteca Axolotl no LoRA.

Ajuste fino distribuído Qwen2-0.5B

Ajuste o modelo Qwen2-0.5B usando kernels LoRA e Liger para treinamento distribuído com uso eficiente de memória e redução de parâmetros.

Ajuste fino distribuído Llama-3.2-3B com Unsloth

Ajuste o Llama-3.2-3B usando treinamento distribuído em várias GPUs com a biblioteca Unsloth para um treinamento otimizado e eficiente em termos de parâmetros.

Ajuste fino do Llama 3.1 8B com o LLM Foundry

Ajuste o modelo Llama 3.1 8B usando o Mosaic LLM Foundry com estratégias de treinamento distribuído e avaliação do modelo.

Ajuste fino do GPT-OSS 120B com DDP e FSDP

Ajuste fino do modelo GPT-OSS 120B da OpenAI usando ajuste fino supervisionado em GPUs H100 com estratégias de treinamento distribuído DDP e FSDP.

Treinamento distribuído com PyTorch FSDP

Ensinar modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para distribuir os parâmetros do modelo entre várias GPUs.

Tutorial

Descrição

Inferência em lotes do Qwen2.5-32B com Ray Data e vLLM

Execute inferência multilíngue em lotes com oito réplicas persistentes de vLLM do Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog.

Ajuste fino do modelo Qwen3-4B

Ajuste fino de peso total do modelo Qwen3-4B em uma única GPU H100 usando Aprendizagem por Reforço de Transformer (TRL), com precisão mista BF16 e checkpointing de gradiente para treinamento com eficiência de memória.

Ajuste fino Llama-3.2-3B com Unsloth

Ajuste o Llama-3.2-3B usando a biblioteca Unsloth.

Ajuste fino do GPT-OSS 20B

Otimize o modelo gpt-oss-20b da OpenAI em 8 GPUs H100, usando paralelismo de dados distribuídos e LoRA para otimização eficiente de parâmetros.

Ajuste fino supervisionado usando DeepSpeed e TRL

Utilize a API Python para GPU sem servidor para executar o ajuste fino supervisionado (SFT) usando a biblioteca TRL com a otimização DeepSpeed ZeRO Stage 3.

Ajuste fino do LoRA usando o Axolotl

Utilize a API Python para GPU sem servidor para ajustar um modelo Olmo3 7B usando a biblioteca Axolotl no LoRA.

Ajuste fino distribuído Qwen2-0.5B

Ajuste o modelo Qwen2-0.5B usando kernels LoRA e Liger para treinamento distribuído com uso eficiente de memória e redução de parâmetros.

Ajuste fino distribuído Llama-3.2-3B com Unsloth

Ajuste o Llama-3.2-3B usando treinamento distribuído em várias GPUs com a biblioteca Unsloth para um treinamento otimizado e eficiente em termos de parâmetros.

Ajuste fino do Llama 3.1 8B com o LLM Foundry

Ajuste o modelo Llama 3.1 8B usando o Mosaic LLM Foundry com estratégias de treinamento distribuído e avaliação do modelo.

Ajuste fino do GPT-OSS 120B com DDP e FSDP

Ajuste fino do modelo GPT-OSS 120B da OpenAI usando ajuste fino supervisionado em GPUs H100 com estratégias de treinamento distribuído DDP e FSDP.

Treinamento distribuído com PyTorch FSDP

Ensinar modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para distribuir os parâmetros do modelo entre várias GPUs.

Vídeo demonstrativo

Este vídeo apresenta em detalhes o exemplo de notebook "Ajuste fino do Llama-3.2-3B com Unsloth" (12 minutos).