RuntimeAI
Visualização
Este recurso está em Pré-visualização Pública.
O AI Runtime é uma oferta de compute de GPU serverless no Databricks destinada a cargas de trabalho de aprendizagem profunda. Você pode usar o AI Runtime para treinar e fazer ajustes finos em modelos personalizados usando seus frameworks favoritos e obter eficiência, desempenho e qualidade de ponta.
Começar
Execute sua primeira carga de trabalho em minutos usando nossos guias de início rápido.
-
- 🚀 Databricks CLI quickstart
- Veio de um cluster do Slurm ou do Kubernetes? Ensine no AI Runtime a partir do seu terminal em minutos.
-
- 📓 Início rápido do notebook
- Anexe seu notebook a uma GPU em segundos e desenvolva de forma interativa.
-
- ⚡ Ray
- Veio de um cluster Ray? Execute o Ray no AI Runtime com suporte a dashboard.
-
- 🧭 Visão geral
- Conheça os pontos-chave sobre o AI Runtime em dois minutos: GPUs disponíveis, como funciona e limitações.
recurso
O AI Runtime é uma plataforma de GPU full-stack, com várias maneiras de se conectar a GPUs, ferramentas integradas de observabilidade e depuração e ambientes pré-criados.
Connect to Serverless GPUs : Acesse GPUs Serverless de onde você estiver trabalhando.
-
- cadernos
- Anexe um notebook ao serverless GPU compute e desenvolva interativamente, sem configuração de cluster.
-
- IDE sobre SSH
- Conecte-se a partir de sua IDE ou terminal por meio de um túnel SSH para trabalhar diretamente em um nó de GPU.
-
- CLI do Databricks
- Envie e gerencie jobs de treinamento de GPU distribuídos a partir do seu laptop usando configurações de job em YAML.
-
- Agentes de AI
- Use a habilidade de agente
databricks-ai-runtimepara enviar, monitorar e gerenciar jobs de treinamento de GPU do seu AI agent.
-
- Ray
- Execute o Ray Core, o Ray Data, o Ray Train e o Ray Tune em compute de GPU serverless.
Gerenciamento de dependências : controle as bibliotecas do Python e do sistema com as quais sua carga de trabalho é executada.
-
- Ambientes pré-construídos
- Comece a partir de um ambiente Standard mínimo ou de um ambiente Databricks AI pré-carregado com frameworks de ML.
Loading data into GPUs : Envie dados de treinamento para suas GPUs de maneira eficiente.
-
- Carregadores de dados eficientes
- Transmita dados de volumes do Unity Catalog com carregadores tolerantes a falhas criados para alta utilização de GPU.
Depuração e observabilidade : acompanhe experimentos, inspecione a saída e diagnostique falhas.
-
- MLflow para aprendizagem profunda
- Acompanhe experimentos, métricas e execuções com o MLflow.
-
- Visualizador de logs
- View a saída de treinamento e monitore o uso de recursos de GPU enquanto o seu código é executado.
-
- Depuração com agentes
- Use o Genie Code para gerar código de treinamento, resolver problemas de ambiente e depurar falhas de GPU.
Programação e servir em tempo real : passe do desenvolvimento interativo para jobs programados e endpoints.
-
- Programar workloads de GPU
- Implante o código de treinamento com Pacotes de Automação Declarativa, agende execuções e crie fluxos de trabalho de GPU e CPU de multitarefas.
-
- Disponibilize seus modelos
- Implante seus modelos treinados atrás de um endpoint escalável com o Model Serving.
Exemplos
Explore exemplos de ponta a ponta de Notebooks e da CLI do Databricks para o AI Runtime.
-
- Machine Learning clássico
- XGBoost acelerado por GPU, predição tabular zero-shot e previsão de séries temporais.
-
- Sistemas de recomendação
- Ensinar modelos de recomendação de aprendizagem profunda, como arquiteturas de torre dupla (two-tower).
-
- Visão computacional
- Cargas de trabalho de detecção de objetos e classificação de imagens em GPUs.
-
- Modelos OSS de pós-treinamento (LLMs)
- Otimize e pós-treine LLMs de código aberto com LoRA, ajuste fino completo e bibliotecas como TRL, Unsloth e Axolotl.
-
- Inferência de batch
- Faça a execução de inferência em lotes em grande escala com Ray Data e vLLM em várias GPUs.
-
- Treinamento distribuído com múltiplas GPUs
- Escalone o treinamento em várias GPUs e nós com DDP, FSDP e DeepSpeed.
guia
Guias focados em tarefas para migrar cargas de trabalho para o AI Runtime e aproveitar ao máximo suas GPUs.
-
- Migrar do Slurm
- Mapeie seus scripts em lote do Slurm, inicializadores distribuídos e armazenamento compartilhado para a CLI do Databricks.
-
- Migrar cargas de trabalho clássicas de GPU
- Mova uma carga de trabalho de aprendizagem profunda existente de um cluster clássico do Databricks para o AI Runtime.
-
- Desempenho e resiliência
- Melhore o throughput de treinamento e torne os jobs de execução longa mais resilientes a falhas.
Outros recursos
Encontre conteúdo útil: as atualizações de produto mais recentes e como o AI Runtime funciona nos bastidores.
-
- Atualizações de produto
- Consulte as atualizações e os anúncios de produtos mais recentes do AI Runtime.
-
- Como funciona o AI Runtime nos bastidores
- Leia sobre como a Databricks mantém as GPUs confiáveis no AI Runtime.