メインコンテンツまでスキップ

AI ランタイム 上の Ray

備考

プレビュー

この機能は パブリック プレビュー段階です。

注記

このページでは、AI ランタイム 上の Ray について説明します。Databricks Runtime 機械学習 を使用して Databricks クラシック コンピュート上で Ray を使用している場合は、「Databricks 上の Ray」を参照してください。

Ray は、Python ワークロードをスケーリングするためのオープンソースフレームワークです。インフラストラクチャのプロビジョニングを自動的に処理するServerless GPU コンピュートを使用して、AI Runtime 上で Ray クラスターを作成し、Ray アプリケーションを実行できます。

ノートブックで Ray を使用する

ノートブックが AI ランタイム GPU コンピュートに接続されている場合は、serverless_gpu パッケージの ray_init() を使用して、アタッチされたコンピュート上で Ray を起動します:

Python
from serverless_gpu import ray_init

ray_init()

ray_init() Databricks ドライバープロキシ経由でアクセスできるように Ray ダッシュボードを構成し、ノートブックの出力にダッシュボード URL を表示します。コードの実行中にダッシュボードを使用して、Ray ジョブ、タスク、およびリソースの使用状況を調査します。

注記

ray_init() 環境バージョン 5 以降が必要です。Databricks AI v5 には Ray が含まれています。Standard v5 を使用する場合は、ray_init() を呼び出す前に Ray をインストールしてください。

ノートブックの例

説明

Ray Core の Hello World

アタッチされたコンピュート上で非同期 GPU タスクを送信し、Ray ダッシュボードでスケジューリングを検査して、結果を取得します。

Ray DataとvLLMを使用したQwen2.5-32Bバッチ推論

8基のH100 GPU上で8つの永続的なvLLMレプリカを使用して多言語バッチ推論を実行し、その結果をUnity CatalogにParquetとして保存します。

説明

Ray Core の Hello World

アタッチされたコンピュート上で非同期 GPU タスクを送信し、Ray ダッシュボードでスケジューリングを検査して、結果を取得します。

Ray DataとvLLMを使用したQwen2.5-32Bバッチ推論

8基のH100 GPU上で8つの永続的なvLLMレプリカを使用して多言語バッチ推論を実行し、その結果をUnity CatalogにParquetとして保存します。

AI ランタイム CLI で Ray を使用する

AI Runtime CLI は、シングルノードおよびマルチノード構成での Ray をサポートしています。ワークロードの command にブートストラップスクリプトを含めます。これにより、ワークロードの起動時に Ray クラスターが開始され、ヘッドノードとワーカーノードが調整されます。Ray hello world の例で、このパターンについて説明します。

AI ランタイムは、Ray CoreRay DataRay TrainRay Tuneを含むRayのコアライブラリをサポートしています。Standard環境では、rayまたは関連するエクストラ(ray[data]ray[train]、またはray[tune])をワークロードの依存関係に追加してください。Databricks AI環境にはRayが含まれています。

CLI の例

説明

Ray の Hello World の例

クラスターブートストラップパターンを含む、Ray Core、Ray Train、Ray Data、Ray Tune の最小限のシングルノードおよびマルチノードの例。

Ray Train を使用した分散トレーニング

Ray Train と PyTorch を使用して、複数のノードで大規模言語モデルをファインチューニングします。

Ray Data と vLLM を使用したバッチ推論

分散データ読み込みには Ray Data を、効率的なモデルサービングには vLLM を使用して、大規模なバッチ推論を実行します。

Ray Tune を使用したハイパーパラメーター検索

Ray Tune を使用して Qwen2.5 の LoRA ファインチューニングのハイパーパラメーターを検索し、GPU ごとに 1 つのトライアルを実行して、ASHA スケジューラでパフォーマンスの低いトライアルを早期に停止します。

説明

Ray の Hello World の例

クラスターブートストラップパターンを含む、Ray Core、Ray Train、Ray Data、Ray Tune の最小限のシングルノードおよびマルチノードの例。

Ray Train を使用した分散トレーニング

Ray Train と PyTorch を使用して、複数のノードで大規模言語モデルをファインチューニングします。

Ray Data と vLLM を使用したバッチ推論

分散データ読み込みには Ray Data を、効率的なモデルサービングには vLLM を使用して、大規模なバッチ推論を実行します。

Ray Tune を使用したハイパーパラメーター検索

Ray Tune を使用して Qwen2.5 の LoRA ファインチューニングのハイパーパラメーターを検索し、GPU ごとに 1 つのトライアルを実行して、ASHA スケジューラでパフォーマンスの低いトライアルを早期に停止します。