Use o Genie Code com o AI Runtime
Visualização
Esse recurso está em Prévia Pública.
O Genie Code ajuda você a desenvolver e solucionar problemas de cargas de trabalho de aprendizagem profunda em notebooks conectados ao AI Runtime. Ele pode gerar código de treinamento distribuído, resolver problemas de ambiente e dependência e investigar falhas de carga de trabalho de GPU.

Requisitos
Para usar o Genie Code com o AI Runtime:
- Atenda aos requisitos para as capacidades agentic do Genie Code.
- Tenha acesso ao AI Runtime em uma região que suporte ambos os produtos. Consulte requisitos do AI Runtime e disponibilidade geográfica do Genie Code.
- Conecte um notebook ao AI Runtime usando compute de GPU serverless. Consulte Conectar ao AI Runtime.
Introdução
-
Abra um notebook do Databricks.
-
Conecte o notebook ao AI Runtime. Consulte Conectar ao AI Runtime.
-
Abra o painel do Genie Code.
-
Descreva a carga de trabalho que você deseja desenvolver ou o problema que deseja resolver.
-
Revise o plano proposto, as alterações de código e as ações antes de aprová-los.
O Genie Code pode cometer erros. Revise o código gerado, as alterações de ambiente e outras ações propostas antes de executá-las. Alguns diagnósticos exigem Logs adicionais ou contexto de carga de trabalho.
Com o que o Genie Code pode ajudar?
Desenvolver workloads de treinamento distribuído
O Genie Code pode gerar ou atualizar código de treinamento para o AI Runtime. Ele pode ajudar você a selecionar uma estratégia distribuída apropriada do PyTorch, usar a API @distributed do pacote serverless_gpu e aplicar padrões do AI Runtime para carregamento de dados, checkpointing e acompanhamento do MLflow. Para detalhes e exemplos da API, consulte treinamento distribuído em Notebooks.
Resolver problemas de ambiente e dependência
O Genie Code pode inspecionar o ambiente atual, distinguir falhas de compatibilidade de pacotes de alterações de código ou API e recomendar correções direcionadas. Ele também pode ajudar você a escolher entre os ambientes Databricks AI e Standard com base nas dependências da sua carga de trabalho. Para obter informações sobre os ambientes disponíveis, consulte Configure seu ambiente.
Depurar cargas de trabalho distribuídas e de GPU
O Genie Code pode usar a saída do notebook e os logs disponíveis para investigar falhas de treinamento distribuído, erros de comunicação, travamentos de treinamento e problemas de memória de GPU. Isso pode ajudar a identificar a falha original e distingui-la de erros downstream em outras classificações. Para obter informações sobre como visualizar logs de treinamento distribuído, consulte Acompanhamento de experimentos e observabilidade.
Exemplos de prompts
Desenvolver workloads de treinamento distribuído
- “Atualize este notebook para executar treinamento distribuído em todas as oito GPUs H100 no AI Runtime.”
- "Revise este notebook de treinamento distribuído e corrija seu uso de
serverless_gpue MLflow." - “Adapte esta carga de trabalho de treinamento para o AI Runtime e explique as mudanças importantes.”
Resolver problemas de ambiente e dependência
- "Este notebook parou de funcionar depois que instalei um novo pacote. Inspecione o ambiente e determine se o problema é uma questão de dependência ou uma alteração na API de código."
- "Esta carga de trabalho deve usar o ambiente Databricks AI ou Standard? Revise suas dependências e recomende um ambiente antes de alterar qualquer coisa."
- "Diagnostique este erro de compatibilidade de pacote e recomende a menor alteração apropriada."
Depurar cargas de trabalho distribuídas e de GPU
- “Analise esta execução de treinamento distribuído com falha usando a saída disponível de cada classificação e identifique a causa raiz.”
- "Por que este workload distribuído está travando? Use a saída do notebook para recomendar o próximo passo de depuração."
- "Investigue esta falha de memória da GPU e recomende o próximo passo baseado em evidências."