AI Runtime 向けのレガシー Python CLI クイックスタート
このドキュメントは廃止されており、更新されない可能性があります。
Python ベースの air CLI は databricks-air パッケージとともにインストールされますが、現在は非推奨となり、積極的にメンテナンスされていません。
新しいワークロードには Databricks CLI を使用してください。AI Runtime での Databricks CLI の使用を参照してください。
3 つのステップで AI ランタイム CLI を使用して最初のトレーニングジョブを送信します: train.yaml 設定を記述し、air run で実行し、ランをインスペクトします。開始する前に、CLI をインストールして認証を構成してください。
ステップ1: YAML設定を作成する
ワークロードを説明する train.yaml を作成します。最小限の構成には、エクスペリメント名、コンピュート仕様、コマンドが必要です。以下のコマンドはローカルコードなしで実行されるため、すぐに最初のランを送信できます。
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"
独自のコードを実行する
ローカルのトレーニングスクリプトをランするには、Python の依存関係をリストする environment ブロックと、ローカルコードをuploadする code_source ブロックを追加します。train.yaml の横にスクリプトを配置します:
my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py
この設定により、リストされた依存関係がインストールされ、現在のディレクトリ (root_path: .) が upload され、単一の A10 GPU で train.py がランされます。$CODE_SOURCE_PATH は、リモートノード上の upload されたコードの場所を解決します。Databricks では、パスをハードコーディングするのではなく、これを使用することを推奨しています。environment.version は Serverless GPU 環境バージョンを選択するものであり、オプションです(default は '4' です)。利用可能なすべてのバージョンについては、環境バージョンを参照してください。
完全なフィールドリファレンスについては、レガシー Python CLI 向け Workload YAML リファレンスを参照してください。
ステップ2:ランを送信する
ワークロードを送信します。
air run --file train.yaml
CLI は、ローカルコードをuploadし (code_source を構成している場合)、ジョブを送信して、ラン ID を出力します。その ID を使用して、後のコマンドでランの検査、監視、およびキャンセルを行います。
この送信により、experiment_name で指定された名前の MLflow エクスペリメントにランが作成されます (1 つのエクスペリメントには多くのランを保持できます)。そのランによって、ワークロードのメトリクス、パラメーター、アーティファクト、およびLogがキャプチャされ、すべてワークスペースの MLflow UI で表示できます。Logs は MLflow の外でも利用可能です。ターミナルやファイルにストリームするか、後で air logs で download してください (ステップ 3 を参照)。
完了するまでLogsを監視するには、--watchを追加します:
air run --file train.yaml --watch
ステップ 3: ランを検査する
ステータスを確認します:
air get run <run-id>
出力には、ワークスペースUI内の実行のMLflowエクスペリメントおよびMLflowランへのクリック可能なLinkが含まれます。
Logsのストリームまたはdownload:
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/
分散ワークロードは複数のノードにまたがって実行されます。デフォルトでは、air logs はノード 0 からストリームします。特定のLogsを表示するには、--node を渡します。ストリーミングする代わりに --download-to を使用して、Logs をローカルディレクトリに書き込みます。
最近のランの一覧:
air list runs --limit 10
air list runs --active
ランをキャンセルします:
air cancel <run-id>
一般的なパターン
コマンドラインから YAML フィールドをオーバーライドします:
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120
送信せずに構成を検証する:
air run --file train.yaml --dry-run
送信を安全に再試行可能にします。
air run --file train.yaml --idempotency-key my-unique-key
同じキーが以前に使用されている場合、新しいランを作成する代わりに既存のランが返されます。