Migrar cargas de trabalho clássicas de GPU para serverless
Se você estiver migrando uma carga de trabalho de aprendizagem profunda existente de um cluster clássico do Databricks (com Databricks Runtime ML) para o serverless (com o AI Runtime), siga os passos seguintes:
- Substituir código dependente de cluster. Remova quaisquer referências a treinamento distribuído baseado em Spark (por exemplo,
TorchDistributor) e substitua-as pelo decorador@distributeddeserverless_gpu. - Atualizar o carregamento de dados. Substituir caminhos diretos do DBFS por caminhos de volumes do Unity Catalog (
/Volumes/...). Substituir operações locais do Spark DataFrame pelo Spark Connect. Para a transmissão de dados baseados em arquivos de volumes, useUCVolumeDatasetdeserverless_gpu.data. Consulte Carregar dados no AI Runtime. - Configure seu ambiente. Algumas bibliotecas pré-instaladas do Databricks Runtime ML não estão disponíveis no AI Runtime. Configure um ambiente de GPU Serverless e instale os pacotes que sua carga de trabalho precisa com
%pip install. Consulte Configurar seu ambiente. - Update checkpoint paths. Move checkpoints from DBFS or local storage to Unity Catalog volumes (
/Volumes/<catalog>/<schema>/<volume>/...). For distributed checkpointing, useUCVolumeWriterandUCVolumeReaderfromserverless_gpu.data, which stage I/O through local NVMe. See Model checkpointing. - Revise sua configuração do MLflow. No AI Runtime, a API
.distributed()cria execuções do MLflow automaticamente. Para personalizar a experiência, defina-a com um caminho absoluto. Para retomar execuções interrompidas, defina um nome de execução. Consulte a integração com o MLflow. - Teste interativamente primeiro. Valide sua carga de trabalho em um notebook interativo antes de programá-la como um job.