Pular para o conteúdo principal

Guias do usuário para AI Runtime

info

Visualização

Esse recurso está em Pré-lançamento público.

Monitore o uso e os custos de GPU com a tabela do sistema de uso faturável, encontre notebooks de exemplo e solucionar erros comuns.

Migrar do Slurm​

If you are coming from a Slurm cluster rather than classic Databricks, see Migrate from Slurm for how sbatch, srun/torchrun, partitions, and shared filesystems map onto the Databricks CLI.

Monitore o uso e os custos​

Você pode monitorar seus gastos com GPU do AI Runtime consultando a tabela do sistema de uso faturável (system.billing.usage). A query a seguir retorna o uso total para cargas de trabalho de GPU Serverless:

SQL
SELECT
SUM(usage_quantity)
FROM
system.billing.usage
WHERE
product_features.serverless_gpu IS NOT NULL

Para obter mais informações sobre o esquema da tabela de uso faturável, consulte Referência da tabela do sistema de uso faturável.

O AI Runtime cobra por hora de GPU na SKU de treinamento de modelo pelos seguintes preços:

  • H100 sob demanda: $ 7,00/hora de GPU (EUA Leste)
  • A10 sob demanda: $ 2,50/hora por GPU (Leste dos EUA)

Notebooks de exemplo​

As seguintes categorias de notebooks de exemplo estão disponíveis para ajudá-lo a começar:

Categoria

Descrição

Grandes modelos de linguagem (LLMs)

Ajuste fino de grandes modelos de linguagem, incluindo métodos eficientes em parâmetros (LoRA, QLoRA)

Visão computador

Detecção de objetos, classificação de imagens e outras tarefas de CV

Sistemas de recomendação de aprendizagem profunda

Criação de sistemas de recomendação usando abordagens modernas de aprendizagem profunda, como modelos de duas torres

ML clássico

Tarefas tradicionais de ML, incluindo treinamento de modelo XGBoost e previsão de série temporal

Treinamento distribuído com múltiplas GPUs

Dimensionamento de treinamento em várias GPUs usando a API de GPU Serverless

Categoria

Descrição

Grandes modelos de linguagem (LLMs)

Ajuste fino de grandes modelos de linguagem, incluindo métodos eficientes em parâmetros (LoRA, QLoRA)

Visão computador

Detecção de objetos, classificação de imagens e outras tarefas de CV

Sistemas de recomendação de aprendizagem profunda

Criação de sistemas de recomendação usando abordagens modernas de aprendizagem profunda, como modelos de duas torres

ML clássico

Tarefas tradicionais de ML, incluindo treinamento de modelo XGBoost e previsão de série temporal

Treinamento distribuído com múltiplas GPUs

Dimensionamento de treinamento em várias GPUs usando a API de GPU Serverless

Para a lista completa, consulte notebooks de exemplo do AI Runtime.

Solução de problemas​

O Genie Code pode ajudar a resolver problemas de ambiente e dependência e investigar falhas de GPU e de carga de trabalho distribuída em notebooks conectados ao AI Runtime. Consulte Usar o Genie Code com o AI Runtime.

Para depurar interativamente no compute, use o terminal web para execução de comandos shell, inspecionar o uso da GPU com nvidia-smi e gerenciar arquivos. O terminal web está disponível quando conectado à versão 5 ou acima do ambiente de GPU Serverless. Consulte Execução de comandos shell no terminal web do Databricks.

ValueError: numpy.dtype size changed, may indicate binary incompatibility. Expected 96 from C header, got 88 from PyObject​

O erro geralmente ocorre quando há uma incompatibilidade entre as versões do NumPy usadas durante a compilação de um pacote dependente e a versão do NumPy instalada atualmente no ambiente de runtime. Essa incompatibilidade ocorre frequentemente devido a alterações na API C do NumPy e é particularmente perceptível do NumPy 1.x para o 2.x. Este erro indica que o pacote Python instalado no notebook pode ter alterado a versão do NumPy.

Solução recomendada:

Verifique a versão do NumPy no runtime e garanta que ela seja compatível com seus pacotes. Consulte as notas sobre a versão do Serverless GPU Compute para o ambiente 4 e o ambiente 3 para obter informações sobre bibliotecas Python pré-instaladas. Se você tiver uma dependência de uma versão diferente do NumPy, adicione essa dependência ao seu ambiente de compute.

O PyTorch não consegue encontrar a libcudnn ao instalar o torch​

Ao instalar uma versão diferente de torch, você poderá ver o erro: ImportError: libcudnn.so.9: cannot open shared object file: No such file or directory. Isso ocorre porque o torch pesquisa a biblioteca cuDNN apenas no caminho local.

Solução recomendada:

Reinstale as dependências adicionando --force-reinstall ao instalar torch:

Python
%pip install torch --force-reinstall