Guias do usuário para AI Runtime
Visualização
Esse recurso está em Pré-lançamento público.
Monitore o uso e os custos de GPU com a tabela do sistema de uso faturável, encontre notebooks de exemplo e solucionar erros comuns.
Migrar do Slurm
If you are coming from a Slurm cluster rather than classic Databricks, see Migrate from Slurm for how sbatch, srun/torchrun, partitions, and shared filesystems map onto the Databricks CLI.
Monitore o uso e os custos
Você pode monitorar seus gastos com GPU do AI Runtime consultando a tabela do sistema de uso faturável (system.billing.usage). A query a seguir retorna o uso total para cargas de trabalho de GPU Serverless:
SELECT
SUM(usage_quantity)
FROM
system.billing.usage
WHERE
product_features.serverless_gpu IS NOT NULL
Para obter mais informações sobre o esquema da tabela de uso faturável, consulte Referência da tabela do sistema de uso faturável.
O AI Runtime cobra por hora de GPU na SKU de treinamento de modelo pelos seguintes preços:
- H100 sob demanda: $ 7,00/hora de GPU (EUA Leste)
- A10 sob demanda: $ 2,50/hora por GPU (Leste dos EUA)
Notebooks de exemplo
As seguintes categorias de notebooks de exemplo estão disponíveis para ajudá-lo a começar:
Categoria | Descrição |
|---|---|
Ajuste fino de grandes modelos de linguagem, incluindo métodos eficientes em parâmetros (LoRA, QLoRA) | |
Detecção de objetos, classificação de imagens e outras tarefas de CV | |
Criação de sistemas de recomendação usando abordagens modernas de aprendizagem profunda, como modelos de duas torres | |
Tarefas tradicionais de ML, incluindo treinamento de modelo XGBoost e previsão de série temporal | |
Dimensionamento de treinamento em várias GPUs usando a API de GPU Serverless |
Para a lista completa, consulte notebooks de exemplo do AI Runtime.
Solução de problemas
O Genie Code pode ajudar a resolver problemas de ambiente e dependência e investigar falhas de GPU e de carga de trabalho distribuída em notebooks conectados ao AI Runtime. Consulte Usar o Genie Code com o AI Runtime.
Para depurar interativamente no compute, use o terminal web para execução de comandos shell, inspecionar o uso da GPU com nvidia-smi e gerenciar arquivos. O terminal web está disponível quando conectado à versão 5 ou acima do ambiente de GPU Serverless. Consulte Execução de comandos shell no terminal web do Databricks.
ValueError: numpy.dtype size changed, may indicate binary incompatibility. Expected 96 from C header, got 88 from PyObject
O erro geralmente ocorre quando há uma incompatibilidade entre as versões do NumPy usadas durante a compilação de um pacote dependente e a versão do NumPy instalada atualmente no ambiente de runtime. Essa incompatibilidade ocorre frequentemente devido a alterações na API C do NumPy e é particularmente perceptível do NumPy 1.x para o 2.x. Este erro indica que o pacote Python instalado no notebook pode ter alterado a versão do NumPy.
Solução recomendada:
Verifique a versão do NumPy no runtime e garanta que ela seja compatível com seus pacotes. Consulte as notas sobre a versão do Serverless GPU Compute para o ambiente 4 e o ambiente 3 para obter informações sobre bibliotecas Python pré-instaladas. Se você tiver uma dependência de uma versão diferente do NumPy, adicione essa dependência ao seu ambiente de compute.
O PyTorch não consegue encontrar a libcudnn ao instalar o torch
Ao instalar uma versão diferente de torch, você poderá ver o erro: ImportError: libcudnn.so.9: cannot open shared object file: No such file or directory. Isso ocorre porque o torch pesquisa a biblioteca cuDNN apenas no caminho local.
Solução recomendada:
Reinstale as dependências adicionando --force-reinstall ao instalar torch:
%pip install torch --force-reinstall