Pular para o conteúdo principal

Ray no AI Runtime

info

Visualização

Esse recurso está em Prévia Pública.

nota

Esta página aborda o Ray no AI Runtime. Se você estiver usando Ray no compute clássico do Databricks com Databricks Runtime ML, consulte Ray no Databricks.

Ray é um framework de código aberto para escalar cargas de trabalho Python. Você pode criar clusters Ray e executar aplicativos Ray no AI Runtime, usando compute de GPU serverless que lida com o provisionamento de infraestrutura automaticamente.

Use o Ray em notebooks

Quando seu notebook estiver conectado ao compute de GPU do AI Runtime, use ray_init() do pacote serverless_gpu para começar o Ray no compute anexado:

Python
from serverless_gpu import ray_init

ray_init()

ray_init() configura o dashboard do Ray para acesso através do proxy do driver do Databricks e imprime a URL do dashboard na saída do notebook. Use o dashboard para inspecionar jobs, tarefas e uso de recursos do Ray enquanto seu código é executado.

nota

ray_init() requer a versão de ambiente 5 ou posterior. O Databricks AI v5 inclui o Ray. Se você usar o Standard v5, instale o Ray antes de chamar ray_init().

Exemplos de Notebooks

Exemplo

Descrição

Hello world do Ray Core

Envie tarefas de GPU assíncronas no compute anexado, inspecione o agendamento no dashboard do Ray e recupere os resultados.

Inferência de lote Qwen2.5-32B com Ray Data e vLLM

Execute a inferência multilíngue em lotes com oito réplicas persistentes do vLLM em 8 GPUs H100 e salve os resultados como Parquet no Unity Catalog.

Exemplo

Descrição

Hello world do Ray Core

Envie tarefas de GPU assíncronas no compute anexado, inspecione o agendamento no dashboard do Ray e recupere os resultados.

Inferência de lote Qwen2.5-32B com Ray Data e vLLM

Execute a inferência multilíngue em lotes com oito réplicas persistentes do vLLM em 8 GPUs H100 e salve os resultados como Parquet no Unity Catalog.

Use o Ray com a CLI do AI Runtime

A CLI do AI Runtime oferece suporte ao Ray em configurações de nó único e multinó. Inclua um script de bootstrap em command da carga de trabalho, que inicia o cluster Ray e coordena os nós head e worker quando a carga de trabalho é iniciada. Os exemplos de Ray hello world percorrem esse padrão.

O AI Runtime oferece suporte às bibliotecas principais do Ray, incluindo Ray Core, Ray Data, Ray Train e Ray Tune. Com o ambiente Standard, adicione ray ou o extra relevante (ray[data], ray[train] ou ray[tune]) às dependências da sua carga de trabalho. O ambiente Databricks AI inclui o Ray.

Exemplos de CLI

Exemplo

Descrição

Exemplos de hello world do Ray

Exemplos mínimos de nó único e múltiplos nós para Ray Core, Ray Train, Ray Data e Ray Tune, incluindo o padrão de bootstrap de cluster.

Treinamento distribuído com Ray Train

Faça o ajuste fino de um grande modelo de linguagem em vários nós usando Ray Train e PyTorch.

Inferência de lote com Ray Data e vLLM

Execute inferência em lotes em grande escala usando Ray Data para carregamento de dados distribuído e vLLM para servindo modelo eficiente.

Pesquisa de hiperparâmetros com Ray Tune

Pesquise hiperparâmetros de ajuste fino de LoRA para Qwen2.5 com Ray Tune, executando um teste por GPU e interrompendo testes com baixo desempenho precocemente com o programador ASHA.

Exemplo

Descrição

Exemplos de hello world do Ray

Exemplos mínimos de nó único e múltiplos nós para Ray Core, Ray Train, Ray Data e Ray Tune, incluindo o padrão de bootstrap de cluster.

Treinamento distribuído com Ray Train

Faça o ajuste fino de um grande modelo de linguagem em vários nós usando Ray Train e PyTorch.

Inferência de lote com Ray Data e vLLM

Execute inferência em lotes em grande escala usando Ray Data para carregamento de dados distribuído e vLLM para servindo modelo eficiente.

Pesquisa de hiperparâmetros com Ray Tune

Pesquise hiperparâmetros de ajuste fino de LoRA para Qwen2.5 com Ray Tune, executando um teste por GPU e interrompendo testes com baixo desempenho precocemente com o programador ASHA.