Visão geral
Visualização
Esse recurso está em Prévia Pública.
O AI Runtime é uma oferta de compute no Databricks destinada a cargas de trabalho de aprendizagem profunda e traz suporte a GPU para o Databricks Serverless. Você pode usar o AI Runtime para treinar e ajustar modelos personalizados usando seus frameworks favoritos e obter eficiência, desempenho e qualidade de última geração. Para obter uma visão geral de como o compute serverless se encaixa na arquitetura do Databricks, consulte Arquitetura de workspace serverless.
Principais recursos
O AI Runtime combina infraestrutura de GPU gerenciada com um runtime criado para aprendizagem profunda:
- Infraestrutura de GPU totalmente gerenciada : acesso serverless e flexível a GPUs, sem configuração de cluster, seleção de driver ou políticas de autoscale para gerenciar.
- Um runtime dedicado para aprendizagem profunda : escolha um ambiente Standard minimalista para máxima flexibilidade em relação às dependências ou um ambiente de AI completo pré-carregado com frameworks de ML populares.
- Integrado nativamente em notebooks, jobs, Unity Catalog e MLflow para desenvolvimento contínuo, acesso a dados e acompanhamento de experimentos.
Opções de hardware
Todos os aceleradores do AI Runtime provisionam um único nó. O número de GPUs nesse nó depende do tipo de acelerador:
Acelerador | GPUs por nó | Memória GPU | Melhor para | Treinamento distribuído |
|---|---|---|---|---|
1xA10 | 1 | 24 GB | Tarefas de machine learning e aprendizagem profunda de pequeno a médio porte, como modelos clássicos de machine learning ou ajuste fino de modelos de linguagem menores | Não compatível (GPU única) |
1xH100 | 1 | 80 GB | Cargas de trabalho que precisam de mais memória GPU do que 1xA10 oferece, mas que não exigem treinamento distribuído de várias GPUs, como o ajuste fino de modelos de linguagem de médio porte | Não compatível (GPU única) |
8xH100 | 8 | 80 GB por GPU | Cargas de trabalho de AI em larga escala, incluindo treinamento ou ajuste fino de modelos massivos ou execução de tarefas avançadas de aprendizagem profunda | Com suporte ao usar o decorador |
Somente o 8xH100 é compatível com treinamento distribuído de várias GPUs. Para cargas de trabalho de GPU única, escolha 1xA10 ou 1xH100 com base na memória de GPU de que seu modelo precisa.
Casos de uso recomendados
O Databricks recomenda o AI Runtime para quaisquer casos de uso de treinamento de modelos personalizados que envolvam aprendizagem profunda, cargas de trabalho clássicas em larga escala ou GPUs.
Por exemplo:
- Ajuste fino de LLM (LoRA, QLoRA, ajuste fino completo)
- Visão computacional (detecção de objetos, classificação de imagens)
- Sistemas de recomendação baseados em aprendizagem profunda
- Aprendizado por reforço
- Previsão de séries temporais baseada em aprendizagem profunda
Requisitos
Antes de começar, confirme se o seu workspace atende a estes requisitos:
-
Um workspace em uma das seguintes regiões compatíveis com a AWS:
us-west-2us-west-1us-east-1us-east-2ca-central-1sa-east-1
-
A prévia do AI Runtime deve ser habilitada por meio das configurações de administrador do workspace. Consulte Gerenciar prévias do Databricks.
Limitações
Mantenha as seguintes limitações em mente ao planejar uma carga de trabalho do AI Runtime:
- O AI Runtime oferece suporte apenas a aceleradores A10 e H100.
- O AI Runtime não oferece suporte ao perfil de segurança de compliance para os padrões FedRAMP High ou DoD IL5.
- A adição de dependências usando o painel Environments não é compatível com jobs agendados do AI Runtime. Em vez disso, instale as dependências programaticamente usando
%pip installno seu notebook. - Para jobs agendados no AI Runtime, não há suporte para comportamento de recuperação automática para versões de pacotes incompatíveis associadas ao seu notebook.
- As tentativas de conexão do AI Runtime são encerradas após 15 minutos para notebooks interativos e após 24 horas para jobs de notebook ou jobs de CLI. As sessões de notebook conectadas e os jobs de notebook podem ser executados por até dois dias, e os jobs de CLI podem ser executados por até 14 dias. Para jobs de treinamento de modelo de longa execução, implemente o salvamento de pontos de verificação (checkpointing) e reinicie o job quando o Runtime máximo for atingido.
- O AI Runtime fornece acesso sob demanda a recursos de GPU. Embora isso resulte em um acesso fácil e flexível a GPUs, pode haver períodos em que a capacidade esteja restrita ou indisponível na sua região.
- O AI Runtime aproveita GPUs entre regiões em determinados casos durante momentos de alta demanda. Pode haver custos de saída associados a esse uso, e a conectividade de rede entre regiões pode ser limitada em determinados momentos.
Conectar ao AI Runtime
Você pode se conectar ao AI Runtime de forma interativa a partir de notebooks, de um terminal de IDE usando um túnel SSH, de jobs agendados, da API de Jobs e de pacotes de automação declarativa. Para obter instruções passo a passo, consulte Conectar ao AI Runtime.
Configurar ambiente
O AI Runtime oferece dois ambientes Python gerenciados: um ambiente Standard minimalista e um ambiente Databricks AI completo, pré-carregado com frameworks de ML populares como PyTorch e Transformers. Para obter detalhes sobre a escolha de um ambiente, o comportamento de cache, a importação de módulos personalizados e limitações conhecidas, consulte Configurar seu ambiente.
Escolha o ambiente Standard para ter controle total sobre sua pilha de dependências ou o ambiente Databricks AI para ignorar a instalação de frameworks comuns, como PyTorch e Transformers.
Carregar dados no AI Runtime
Entender como o acesso a dados funciona no AI Runtime é essencial para uma experiência tranquila. Para obter detalhes, consulte Carregar dados no AI Runtime.
Treinamento distribuído
O AI Runtime oferece suporte ao treinamento distribuído em várias GPUs no nó único ao qual seu Notebooks está conectado. Usando o decorador @distributed da API Python serverless_gpu, você pode iniciar cargas de trabalho com várias GPUs com PyTorch DDP, FSDP ou DeepSpeed com configuração mínima. Para obter detalhes, consulte Treinamento distribuído em notebooks.
Valide sua carga de trabalho em uma única GPU antes de dimensionar para 8xH100 com o decorador @distributed.
Ray no AI Runtime
O AI Runtime oferece suporte ao Ray para cargas de trabalho de GPU distribuídas, incluindo Ray Core, Ray Data, Ray Train e Ray Tune. Você pode executar jobs do Ray de nó único e de vários nós no serverless GPU compute sem a configuração de clusters. Para obter detalhes e exemplos, consulte Ray no AI Runtime.
Acompanhamento de experimentos e observabilidade
Para integração com o MLflow, visualização de Logs e gerenciamento de pontos de verificação de modelo, consulte Acompanhamento de experimentos e observabilidade.
Colocar cargas de trabalho de treinamento em produção
Implante uma carga de trabalho do AI Runtime com os Pacotes de Automação Declarativa para executar seu próprio código de treinamento, criar jobs com várias tarefas que combinam tarefas de GPU e CPU, programar pipelines e promover do desenvolvimento para a produção. Consulte Colocar cargas de trabalho de treinamento em produção.
Genie Code para aprendizagem profunda
O Genie Code pode ajudar a desenvolver e solucionar problemas de cargas de trabalho de aprendizagem profunda no AI Runtime. Ele pode gerar código de treinamento distribuído, resolver problemas de ambiente e de dependências, e investigar falhas de GPU e de cargas de trabalho distribuídas. Consulte Usar o Genie Code com o AI Runtime.
guia
Para migração de cargas de trabalho clássicas, notebooks de exemplo e solução de problemas, consulte Guias do usuário para o AI Runtime.