AI ランタイム 上の Ray
プレビュー
この機能は パブリック プレビュー段階です。
このページでは、AI ランタイム 上の Ray について説明します。Databricks Runtime 機械学習 を使用して Databricks クラシック コンピュート上で Ray を使用している場合は、「Databricks 上の Ray」を参照してください。
Ray は、Python ワークロードをスケーリングするためのオープンソースフレームワークです。インフラストラクチャのプロビジョニングを自動的に処理するServerless GPU コンピュートを使用して、AI Runtime 上で Ray クラスターを作成し、Ray アプリケーションを実行できます。
ノートブックで Ray を使用する
ノートブックが AI ランタイム GPU コンピュートに接続されている場合は、serverless_gpu パッケージの ray_init() を使用して、アタッチされたコンピュート上で Ray を起動します:
from serverless_gpu import ray_init
ray_init()
ray_init() Databricks ドライバープロキシ経由でアクセスできるように Ray ダッシュボードを構成し、ノートブックの出力にダッシュボード URL を表示します。コードの実行中にダッシュボードを使用して、Ray ジョブ、タスク、およびリソースの使用状況を調査します。
ray_init() 環境バージョン 5 以降が必要です。Databricks AI v5 には Ray が含まれています。Standard v5 を使用する場合は、ray_init() を呼び出す前に Ray をインストールしてください。
ノートブックの例
例 | 説明 |
|---|---|
アタッチされたコンピュート上で非同期 GPU タスクを送信し、Ray ダッシュボードでスケジューリングを検査して、結果を取得します。 | |
8基のH100 GPU上で8つの永続的なvLLMレプリカを使用して多言語バッチ推論を実行し、その結果をUnity CatalogにParquetとして保存します。 |
AI ランタイム CLI で Ray を使用する
AI Runtime CLI は、シングルノードおよびマルチノード構成での Ray をサポートしています。ワークロードの command にブートストラップスクリプトを含めます。これにより、ワークロードの起動時に Ray クラスターが開始され、ヘッドノードとワーカーノードが調整されます。Ray hello world の例で、このパターンについて説明します。
AI ランタイムは、Ray Core、Ray Data、Ray Train、Ray Tuneを含むRayのコアライブラリをサポートしています。Standard環境では、rayまたは関連するエクストラ(ray[data]、ray[train]、またはray[tune])をワークロードの依存関係に追加してください。Databricks AI環境にはRayが含まれています。
CLI の例
例 | 説明 |
|---|---|
クラスターブートストラップパターンを含む、Ray Core、Ray Train、Ray Data、Ray Tune の最小限のシングルノードおよびマルチノードの例。 | |
Ray Train と PyTorch を使用して、複数のノードで大規模言語モデルをファインチューニングします。 | |
分散データ読み込みには Ray Data を、効率的なモデルサービングには vLLM を使用して、大規模なバッチ推論を実行します。 | |
Ray Tune を使用して Qwen2.5 の LoRA ファインチューニングのハイパーパラメーターを検索し、GPU ごとに 1 つのトライアルを実行して、ASHA スケジューラでパフォーマンスの低いトライアルを早期に停止します。 |