AI Runtime CLI の例
備考
プレビュー
この機能は パブリック プレビュー段階です。
以下の例は、air run -f <config>.yaml を使用して air CLI から送信する、完全なエンドツーエンドのワークロードです。それぞれに、ワークロードYAML、ブートストラップスクリプト、および完全なコードが含まれています。ランを送信したことがない場合は、クイックスタートから始めてください。
-
- FSDP によるマルチノード LLM ファインチューニング
- Llama-3.1-8B の教師ありファインチューニング
torchrunおよび PyTorch 完全シャーディングデータパラレル (FSDP) を使用して、16基のH100 GPU (2ノード) でMLflowにログを記録し、Unity Catalogボリュームにチェックポイントを保存します。
-
- Ray hello world
- Ray Core、Ray Train、Ray Data、および Ray Tune の最小限の動作例。これには、AI Runtime 上で Ray クラスターを実行するための共有ブートストラップパターンが含まれます。
-
- Ray Train による分散トレーニング
- シングルノードで8基のH100 GPUを使い、GPUあたり1つのワーカーを割り当てたRay Trainの
TorchTrainerによる分散データ並列ファインチューニング
-
- Ray Data および vLLM を使用したバッチ推論
- Ray DataとvLLMを使用したオフラインLLMバッチ推論で、単一ノードで8つのH100 GPUを使用し、GPUごとに1つのvLLMレプリカを実行し、結果をParquetとしてUnity Catalogボリュームに書き込みます。
-
- Ray Tuneによるハイパーパラメーター探索
- 4台の1xA10ノードを使用したRay TuneによるQwen2.5-0.5BのLoRAハイパーパラメーター検索。GPUごとに1つのトライアルを実行し、ASHAスケジューラを使用してパフォーマンスの低いトライアルを早期に停止します。