メインコンテンツまでスキップ
非公開のページ
このページは非公開です。 検索対象外となり、このページのリンクに直接アクセスできるユーザーのみに公開されます。

AI Runtime 向けのレガシー Python CLI クイックスタート

重要

このドキュメントは廃止されており、更新されない可能性があります。

Python ベースの air CLI は databricks-air パッケージとともにインストールされますが、現在は非推奨となり、積極的にメンテナンスされていません。

新しいワークロードには Databricks CLI を使用してください。AI Runtime での Databricks CLI の使用を参照してください。

3 つのステップで AI ランタイム CLI を使用して最初のトレーニングジョブを送信します: train.yaml 設定を記述し、air run で実行し、ランをインスペクトします。開始する前に、CLI をインストールして認証を構成してください。

ステップ1: YAML設定を作成する​

ワークロードを説明する train.yaml を作成します。最小限の構成には、エクスペリメント名、コンピュート仕様、コマンドが必要です。以下のコマンドはローカルコードなしで実行されるため、すぐに最初のランを送信できます。

YAML
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"

独自のコードを実行する​

ローカルのトレーニングスクリプトをランするには、Python の依存関係をリストする environment ブロックと、ローカルコードをuploadする code_source ブロックを追加します。train.yaml の横にスクリプトを配置します:

Text
my-project/
├── train.yaml
└── train.py
YAML
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py

この設定により、リストされた依存関係がインストールされ、現在のディレクトリ (root_path: .) が upload され、単一の A10 GPU で train.py がランされます。$CODE_SOURCE_PATH は、リモートノード上の upload されたコードの場所を解決します。Databricks では、パスをハードコーディングするのではなく、これを使用することを推奨しています。environment.version は Serverless GPU 環境バージョンを選択するものであり、オプションです(default は '4' です)。利用可能なすべてのバージョンについては、環境バージョンを参照してください。

完全なフィールドリファレンスについては、レガシー Python CLI 向け Workload YAML リファレンスを参照してください。

ステップ2:ランを送信する​

ワークロードを送信します。

Bash
air run --file train.yaml

CLI は、ローカルコードをuploadし (code_source を構成している場合)、ジョブを送信して、ラン ID を出力します。その ID を使用して、後のコマンドでランの検査、監視、およびキャンセルを行います。

この送信により、experiment_name で指定された名前の MLflow エクスペリメントにランが作成されます (1 つのエクスペリメントには多くのランを保持できます)。そのランによって、ワークロードのメトリクス、パラメーター、アーティファクト、およびLogがキャプチャされ、すべてワークスペースの MLflow UI で表示できます。Logs は MLflow の外でも利用可能です。ターミナルやファイルにストリームするか、後で air logs で download してください (ステップ 3 を参照)。

完了するまでLogsを監視するには、--watchを追加します:

Bash
air run --file train.yaml --watch

ステップ 3: ランを検査する​

ステータスを確認します:

Bash
air get run <run-id>

出力には、ワークスペースUI内の実行のMLflowエクスペリメントおよびMLflowランへのクリック可能なLinkが含まれます。

Logsのストリームまたはdownload:

Bash
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/

分散ワークロードは複数のノードにまたがって実行されます。デフォルトでは、air logs はノード 0 からストリームします。特定のLogsを表示するには、--node を渡します。ストリーミングする代わりに --download-to を使用して、Logs をローカルディレクトリに書き込みます。

最近のランの一覧:

Bash
air list runs --limit 10
air list runs --active

ランをキャンセルします:

Bash
air cancel <run-id>

一般的なパターン​

コマンドラインから YAML フィールドをオーバーライドします:

Bash
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120

送信せずに構成を検証する:

Bash
air run --file train.yaml --dry-run

送信を安全に再試行可能にします。

Bash
air run --file train.yaml --idempotency-key my-unique-key

同じキーが以前に使用されている場合、新しいランを作成する代わりに既存のランが返されます。

その他のリソース​