Pular para o conteúdo principal
Página não listada
Esta página não está listada. Mecanismos de busca não armazenarão nenhuma informação, e somente usuários que possuam o link direto poderão acessá-la

Início rápido da CLI Python herdada para AI Runtime

importante

Esta documentação foi descontinuada e pode não ser atualizada.

A CLI air baseada em Python, instalada com o pacote databricks-air, agora está obsoleta e não é mais mantida ativamente.

Use a CLI do Databricks para novas cargas de trabalho. Consulte Usar a CLI do Databricks com o AI Runtime.

Envie seu primeiro job de treinamento com a CLI do AI Runtime em três passos: escreva uma configuração train.yaml, execute-a com air run e, em seguida, inspecione a execução. Antes de começar, instale a CLI e configure a autenticação.

O passo 1: Escrever uma configuração YAML​

Crie train.yaml descrevendo a carga de trabalho. A configuração mínima requer um nome de experimento, uma especificação de compute e um comando. O comando abaixo é executado sem nenhum código local, para que você possa enviar sua primeira execução imediatamente:

YAML
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"

Execute seu próprio código​

Para executar um script de treinamento local, adicione um bloco environment que liste suas dependências Python e um bloco code_source que faça o upload do seu código local. Coloque seu script junto a train.yaml:

Text
my-project/
├── train.yaml
└── train.py
YAML
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py

Esta configuração instala as dependências listadas, faz upload do diretório atual (root_path: .) e executa train.py em uma única GPU A10. $CODE_SOURCE_PATH aponta para o local do código upload no nó remoto. A Databricks recomenda usar isso em vez de codificar um caminho diretamente. environment.version seleciona a versão do ambiente Serverless GPU e é opcional (o default é '4'). Para todas as versões disponíveis, consulte Environment versions.

Para obter a referência completa de campos, consulte Referência de YAML de Workload para a CLI legada do Python.

Passo 2: Enviar a execução​

Enviar a carga de trabalho:

Bash
air run --file train.yaml

A CLI faz o upload do seu código local (se você configurou um code_source), envia o job e exibe uma ID de execução. Use essa ID para inspecionar, monitorar e cancelar a execução em comandos posteriores.

A submissão cria uma execução no experimento do MLflow nomeado em experiment_name (um experimento pode conter muitas execuções). Essa execução captura as métricas, os parâmetros, os artefatos e os logs da carga de trabalho, todos visíveis na interface de usuário do MLflow no workspace. Os Logs também estão disponíveis fora do MLflow: faça a transmissão deles para o seu terminal ou para um arquivo, ou faça o download deles mais tarde com air logs (consulte o Passo 3).

Para acompanhar os logs até a conclusão, adicione --watch:

Bash
air run --file train.yaml --watch

Etapa 3: Inspecionar a execução​

Verificar o status:

Bash
air get run <run-id>

A saída inclui links clicáveis para o experimento do MLflow e a execução do MLflow da execução na interface do usuário do Workspace.

Transmita ou faça download de logs:

Bash
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/

As cargas de trabalho distribuídas são executadas em vários nós. Por default, air logs transmite a partir do nó 0. Para ver os logs de um nó específico, passe --node. Use --download-to para gravar os logs em um diretório local em vez de fazer a transmissão deles.

Listar execuções recentes:

Bash
air list runs --limit 10
air list runs --active

Cancelar uma execução:

Bash
air cancel <run-id>

Padrões comuns​

Substituir os campos YAML a partir da linha de comando:

Bash
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120

Validar a configuração sem enviar:

Bash
air run --file train.yaml --dry-run

Tornar o envio passível de nova tentativa com segurança:

Bash
air run --file train.yaml --idempotency-key my-unique-key

Se a mesma key já tiver sido usada antes, a execução existente é retornada em vez de criar uma nova.

Recursos adicionais​