Pular para o conteúdo principal

Use o Genie Code com o AI Runtime

info

Visualização

Esse recurso está em Prévia Pública.

O Genie Code ajuda você a desenvolver e solucionar problemas de cargas de trabalho de aprendizagem profunda em notebooks conectados ao AI Runtime. Ele pode gerar código de treinamento distribuído, resolver problemas de ambiente e dependência e investigar falhas de carga de trabalho de GPU.

O Genie Code cria e executa uma carga de trabalho de treinamento de CNN distribuído em oito GPUs H100 em um notebook do AI Runtime.

Requisitos

Para usar o Genie Code com o AI Runtime:

Introdução

  1. Abra um notebook do Databricks.

  2. Conecte o notebook ao AI Runtime. Consulte Conectar ao AI Runtime.

  3. Abra o painel do Genie Code.

  4. Descreva a carga de trabalho que você deseja desenvolver ou o problema que deseja resolver.

  5. Revise o plano proposto, as alterações de código e as ações antes de aprová-los.

importante

O Genie Code pode cometer erros. Revise o código gerado, as alterações de ambiente e outras ações propostas antes de executá-las. Alguns diagnósticos exigem Logs adicionais ou contexto de carga de trabalho.

Com o que o Genie Code pode ajudar?

Desenvolver workloads de treinamento distribuído

O Genie Code pode gerar ou atualizar código de treinamento para o AI Runtime. Ele pode ajudar você a selecionar uma estratégia distribuída apropriada do PyTorch, usar a API @distributed do pacote serverless_gpu e aplicar padrões do AI Runtime para carregamento de dados, checkpointing e acompanhamento do MLflow. Para detalhes e exemplos da API, consulte treinamento distribuído em Notebooks.

Resolver problemas de ambiente e dependência

O Genie Code pode inspecionar o ambiente atual, distinguir falhas de compatibilidade de pacotes de alterações de código ou API e recomendar correções direcionadas. Ele também pode ajudar você a escolher entre os ambientes Databricks AI e Standard com base nas dependências da sua carga de trabalho. Para obter informações sobre os ambientes disponíveis, consulte Configure seu ambiente.

Depurar cargas de trabalho distribuídas e de GPU

O Genie Code pode usar a saída do notebook e os logs disponíveis para investigar falhas de treinamento distribuído, erros de comunicação, travamentos de treinamento e problemas de memória de GPU. Isso pode ajudar a identificar a falha original e distingui-la de erros downstream em outras classificações. Para obter informações sobre como visualizar logs de treinamento distribuído, consulte Acompanhamento de experimentos e observabilidade.

Exemplos de prompts

Desenvolver workloads de treinamento distribuído

  • “Atualize este notebook para executar treinamento distribuído em todas as oito GPUs H100 no AI Runtime.”
  • "Revise este notebook de treinamento distribuído e corrija seu uso de serverless_gpu e MLflow."
  • “Adapte esta carga de trabalho de treinamento para o AI Runtime e explique as mudanças importantes.”

Resolver problemas de ambiente e dependência

  • "Este notebook parou de funcionar depois que instalei um novo pacote. Inspecione o ambiente e determine se o problema é uma questão de dependência ou uma alteração na API de código."
  • "Esta carga de trabalho deve usar o ambiente Databricks AI ou Standard? Revise suas dependências e recomende um ambiente antes de alterar qualquer coisa."
  • "Diagnostique este erro de compatibilidade de pacote e recomende a menor alteração apropriada."

Depurar cargas de trabalho distribuídas e de GPU

  • “Analise esta execução de treinamento distribuído com falha usando a saída disponível de cada classificação e identifique a causa raiz.”
  • "Por que este workload distribuído está travando? Use a saída do notebook para recomendar o próximo passo de depuração."
  • "Investigue esta falha de memória da GPU e recomende o próximo passo baseado em evidências."

Outros recursos