Início rápido da CLI Python herdada para AI Runtime
Esta documentação foi descontinuada e pode não ser atualizada.
A CLI air baseada em Python, instalada com o pacote databricks-air, agora está obsoleta e não é mais mantida ativamente.
Use a CLI do Databricks para novas cargas de trabalho. Consulte Usar a CLI do Databricks com o AI Runtime.
Envie seu primeiro job de treinamento com a CLI do AI Runtime em três passos: escreva uma configuração train.yaml, execute-a com air run e, em seguida, inspecione a execução. Antes de começar, instale a CLI e configure a autenticação.
O passo 1: Escrever uma configuração YAML
Crie train.yaml descrevendo a carga de trabalho. A configuração mínima requer um nome de experimento, uma especificação de compute e um comando. O comando abaixo é executado sem nenhum código local, para que você possa enviar sua primeira execução imediatamente:
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"
Execute seu próprio código
Para executar um script de treinamento local, adicione um bloco environment que liste suas dependências Python e um bloco code_source que faça o upload do seu código local. Coloque seu script junto a train.yaml:
my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py
Esta configuração instala as dependências listadas, faz upload do diretório atual (root_path: .) e executa train.py em uma única GPU A10. $CODE_SOURCE_PATH aponta para o local do código upload no nó remoto. A Databricks recomenda usar isso em vez de codificar um caminho diretamente. environment.version seleciona a versão do ambiente Serverless GPU e é opcional (o default é '4'). Para todas as versões disponíveis, consulte Environment versions.
Para obter a referência completa de campos, consulte Referência de YAML de Workload para a CLI legada do Python.
Passo 2: Enviar a execução
Enviar a carga de trabalho:
air run --file train.yaml
A CLI faz o upload do seu código local (se você configurou um code_source), envia o job e exibe uma ID de execução. Use essa ID para inspecionar, monitorar e cancelar a execução em comandos posteriores.
A submissão cria uma execução no experimento do MLflow nomeado em experiment_name (um experimento pode conter muitas execuções). Essa execução captura as métricas, os parâmetros, os artefatos e os logs da carga de trabalho, todos visíveis na interface de usuário do MLflow no workspace. Os Logs também estão disponíveis fora do MLflow: faça a transmissão deles para o seu terminal ou para um arquivo, ou faça o download deles mais tarde com air logs (consulte o Passo 3).
Para acompanhar os logs até a conclusão, adicione --watch:
air run --file train.yaml --watch
Etapa 3: Inspecionar a execução
Verificar o status:
air get run <run-id>
A saída inclui links clicáveis para o experimento do MLflow e a execução do MLflow da execução na interface do usuário do Workspace.
Transmita ou faça download de logs:
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/
As cargas de trabalho distribuídas são executadas em vários nós. Por default, air logs transmite a partir do nó 0. Para ver os logs de um nó específico, passe --node. Use --download-to para gravar os logs em um diretório local em vez de fazer a transmissão deles.
Listar execuções recentes:
air list runs --limit 10
air list runs --active
Cancelar uma execução:
air cancel <run-id>
Padrões comuns
Substituir os campos YAML a partir da linha de comando:
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120
Validar a configuração sem enviar:
air run --file train.yaml --dry-run
Tornar o envio passível de nova tentativa com segurança:
air run --file train.yaml --idempotency-key my-unique-key
Se a mesma key já tiver sido usada antes, a execução existente é retornada em vez de criar uma nova.