メインコンテンツまでスキップ

クラシックな GPU ワークロードをServerlessに移行する

既存のディープラーニング ワークロードをクラシック Databricks クラスター (Databricks Runtime 機械学習) から Serverless (AI Runtime) に移行する場合は、次のステップに従います:

  1. クラスター依存のコードを置き換えます。 Spark ベースの分散トレーニングへの参照 (TorchDistributor など)@distributed serverless_gpuを削除し、 の デコレータに置き換えます。
  2. データ読み込みの更新。 直接的な DBFS パスを Unity Catalog ボリューム パスに置き換えます (/Volumes/...)。ローカルの Spark DataFrame 操作を Spark Connect に置き換えます。ボリュームからファイルベースのデータを{ストリーミング}するには、serverless_gpu.data の UCVolumeDataset を使用します。AI ランタイムでのデータの読み込みについては、AI ランタイムでのデータの読み込みを参照してください。
  3. 環境を設定します。 一部の Databricks Runtime 機械学習 プリインストール済みライブラリは AI ランタイム では使用できません。Serverless GPU 環境を設定し、%pip install を使用してワークロードに必要なパッケージをインストールします。環境の設定を参照してください。
  4. チェックポイントのパスを更新します。 チェックポイントをDBFSまたはローカルストレージからUnity Catalogボリューム(/Volumes/<catalog>/<schema>/<volume>/...)に移動します。分散チェックポイント処理には、ローカルNVMe経由でI/Oをステージングする、serverless_gpu.dataのUCVolumeWriterおよびUCVolumeReaderを使用します。モデルのチェックポイント処理を参照してください。
  5. MLflow の構成を確認してください。 AI ランタイムでは、.distributed() API が自動的に MLflow のランを作成します。エクスペリメントをカスタマイズするには、絶対パスで設定します。中断されたランを再開するには、ラン名を設定します。MLflow 統合を参照してください。
  6. Test interactively first. Validate your workload in an interactive ノートブック before scheduling it as a ジョブ.