メインコンテンツまでスキップ

AI Runtime CLI の例

備考

プレビュー

この機能は パブリック プレビュー段階です。

以下の例は、air run -f <config>.yaml を使用して air CLI から送信する、完全なエンドツーエンドのワークロードです。それぞれに、ワークロードYAML、ブートストラップスクリプト、および完全なコードが含まれています。ランを送信したことがない場合は、クイックスタートから始めてください。

    • FSDP によるマルチノード LLM ファインチューニング
    • Llama-3.1-8B の教師ありファインチューニングtorchrun および PyTorch 完全シャーディングデータパラレル (FSDP) を使用して、16基のH100 GPU (2ノード) でMLflowにログを記録し、Unity Catalogボリュームにチェックポイントを保存します。
    • Ray hello world
    • Ray Core、Ray Train、Ray Data、および Ray Tune の最小限の動作例。これには、AI Runtime 上で Ray クラスターを実行するための共有ブートストラップパターンが含まれます。
    • Ray Train による分散トレーニング
    • シングルノードで8基のH100 GPUを使い、GPUあたり1つのワーカーを割り当てたRay TrainのTorchTrainerによる分散データ並列ファインチューニング
    • Ray Data および vLLM を使用したバッチ推論
    • Ray DataとvLLMを使用したオフラインLLMバッチ推論で、単一ノードで8つのH100 GPUを使用し、GPUごとに1つのvLLMレプリカを実行し、結果をParquetとしてUnity Catalogボリュームに書き込みます。
    • Ray Tuneによるハイパーパラメーター探索
    • 4台の1xA10ノードを使用したRay TuneによるQwen2.5-0.5BのLoRAハイパーパラメーター検索。GPUごとに1つのトライアルを実行し、ASHAスケジューラを使用してパフォーマンスの低いトライアルを早期に停止します。