概要
プレビュー
この機能は パブリック プレビュー段階です。
AI Runtimeは、ディープラーニングワークロードを目的としたDatabricksコンピュート オファリングであり、 Databricksサーバレスに GPU サポートをもたらします。 AI Runtimeを使用すると、お気に入りのフレームワークを使用してカスタム モデルをトレーニングしたり微調整したりすることができ、最先端の効率、パフォーマンス、品質を得ることができます。 サーバレス コンピュートがDatabricksアーキテクチャにどのように適合するかの概要については、 「 サーバレス ワークスペース アーキテクチャ 」を参照してください。
主な機能
AI Runtimeは、マネージドGPUインフラストラクチャとディープラーニング向けに構築されたランタイムを組み合わせたものです。
- フルマネージド GPU インフラストラクチャ : Serverless、GPU への柔軟なアクセス、クラスター構成、ドライバー選択、オートスケーリングポリシーの管理は不要です。
- ディープラーニング専用ランタイム :依存関係に対する柔軟性を最大限に高める最小限のStandard環境か、人気の機械学習フレームワークがプリロードされたフル機能のAI環境のいずれかを選択します。
- ノートブック、ジョブ、Unity Catalog、MLflow間で ネイティブに統合 されており、シームレスな開発、データアクセス、エクスペリメントのトラッキングを実現します。
ハードウェアオプション
8xB300はパブリックプレビューです
8xB300アクセラレータでのトレーニングはAWSで利用可能ですが、順番待ちリストへの登録が必要です。アクセスをリクエストするには、Databricksアカウントチームまたは営業担当者にお問い合わせの上、詳細をご確認ください。
すべてのAI Runtimeアクセラレータは単一のノードをプロビジョニングします。そのノード上のGPU数は、アクセラレータのタイプによって異なります。
アクセラレータ | GPUs per node | GPU memory | どのようなタスクにベストなのか | 分散学習 |
|---|---|---|---|---|
1xA10 | 1 | 24GB | クラシックな機械学習モデルや小規模言語モデルのファインチューニングなど、中小規模の機械学習およびディープラーニングタスク | サポートされていません(シングルGPU) |
1xH100 | 1 | 80GB | 1xA10よりも多くのGPUメモリを必要とするが、中規模言語モデルのファインチューニングなどのマルチGPU分散トレーニングを必要としないワークロード | サポートされていません(シングルGPU) |
8xH100 | 8 | GPU あたり 80GB | 大規模モデルのトレーニングやファインチューニング、高度なディープラーニングタスクの実行などの大規模なAIワークロード |
|
8xB300 | 8 | GPUあたり288 GB | 最大規模のモデルと最長のコンテキスト長。GPU あたり 288 GB の HBM により、より小規模な GPU では CPU オフロードが必要となるモデルをトレーニングするやバッチサイズを実現できます。 |
|
マルチGPU分散 トレーニング をサポートしているのは、 8xH100 と 8xB300 のみです。シングルGPUワークロードの場合は、モデルに必要なGPUメモリに応じて 1xA10 または 1xH100 を選択してください。
推奨されるユースケース
Databricks recommends AI Runtime for any custom model training use cases that involve ディープラーニング, large-scale classic workloads, or GPUs.
例えば:
- LLM ファインチューニング(LoRA、QLoRA、フル ファインチューニング)
- コンピュータビジョン(オブジェクト検出、画像分類)
- ディープラーニングベースのレコメンデーションシステム
- 強化学習
- ディープラーニングベースの時系列予測
要件
Before you 起動, confirm your ワークスペース meets these requirements:
-
AWS がサポートする次のいずれかのリージョンにあるワークスペース:
us-west-2us-west-1us-east-1us-east-2ca-central-1sa-east-1
-
AI Runtimeのプレビューは、ワークスペース管理者の設定から有効にする必要があります。Databricks プレビューの管理を参照してください。
制限事項
AI ランタイムワークロードを計画する際は、以下の制限事項に注意してください。
-
AI ランタイムは、A10、H100、および B300 アクセラレータのみをサポートしています。
-
AI ランタイム doesn't support the コンプライアンス security profile for the FedRAMP High or DoD IL5 standards.
-
Adding dependencies using the Environments panel is not supported for AI ランタイム scheduled ジョブ.Install dependencies programmatically using
%pip installin your notebook instead. -
AI Runtime上のスケジュールされたジョブでは、ノートブックに関連付けられている互換性のないパッケージバージョンの自動リカバリ動作はサポートされていません。
-
AI ランタイムの接続試行は、対話型ノートブックの場合は15分後、ノートブックジョブまたはCLIジョブの場合は24時間後にタイムアウトします。接続されたノートブックセッションおよびノートブックジョブは最大2日間実行でき、CLIジョブは最大14日間実行できます。長時間実行されるモデルのトレーニングジョブでは、チェックポイントを実装し、最大ランタイムに達したときにジョブを再起動してください。
-
AI Runtimeは、GPU リソースへのオンデマンド アクセスを提供します。 これによりGPUへの容易かつ柔軟なアクセスが可能になりますが、お住まいの地域では容量が制限されたり、利用できなくなる期間が生じる可能性があります。
-
AI Runtimeは、需要が高い状況において、特定のケースでリージョンをまたいだGPUを活用します。このような利用にはエグレスコストが発生する場合があり、特定の時間帯にはリージョン間のネットワーク接続が制限される可能性があります。
AI ランタイムへの接続
ノートブック、SSH トンネルを使用した IDE ターミナル、スケジュールされたジョブ、Jobs API、および Declarative Automation Bundles から、AI ランタイム に対話的に接続できます。詳細な手順については、ノートブックから AI ランタイム に接続するを参照してください。
環境の設定
AI ランタイムは、2つのマネージドPython環境(最小限のStandard環境と、PyTorchやTransformersなどの人気の機械学習フレームワークがプリロードされたフル機能のDatabricks AI環境)を提供します。環境の選択、キャッシュの動作、カスタムモジュールのインポート、既知の制限事項の詳細については、「環境の設定」を参照してください。
依存関係スタックを完全に制御するには Standard 環境を選択し、PyTorchやTransformersなどの一般的なフレームワークのインストールをスキップするには Databricks AI 環境を選択します。
AI ランタイムへのデータの読み込み
AI Runtimeにおけるデータアクセスの仕組みを理解することは、スムーズな操作性を実現するために不可欠です。 詳細については、 AI Runtimeへのデータの読み込みを参照してください。
分散トレーニング
AI Runtimeは、ノートブックが接続されている単一ノード上の複数のGPUにわたる分散トレーニングをサポートしています。serverless_gpu Python APIの@distributedデコレーターを使用すると、最小限の設定でPyTorch DDP、FSDP、またはDeepSpeedを使用したマルチGPUワークロードを起動できます。詳細については、ノートブックでの分散トレーニングを参照してください。
@distributed デコレータを使用して 8xH100 にスケールアップする前に、単一のGPUでワークロードを検証します。
AI Runtime上のRay
AI ランタイム は、Ray Core、Ray Data、Ray Train、Ray Tune をはじめとする、分散 GPU ワークロード向けの Ray をサポートしています。クラスターを設定することなく、Serverless GPU コンピュートでシングルノードおよびマルチノードの Ray ジョブを実行できます。詳細と例については、Ray on AI ランタイム を参照してください。
実験の追跡と観察可能性
For MLflow integration, viewing Logs, and GPU モニタリング, see エクスペリメント tracking and observability.モデルのチェックポイント作成については、AIランタイムでのトレーニングのパフォーマンスと耐障害性の向上を参照してください。
トレーニング ワークロードの本番運用
宣言型オートメーションバンドルを使用して AI ランタイムのワークロードをデプロイし、独自のトレーニングコードを実行し、GPU タスクと CPU タスクを組み合わせたマルチタスク・ジョブを構築し、パイプラインをスケジュールし、開発環境から本番運用へ昇格させます。GPU ワークロードをスケジュールし、タスクを構成するを参照してください。
ディープラーニングのためのGenie Code
Genie Code can help develop and troubleshoot ディープラーニング workloads on AI ランタイム.It can generate distributed トレーニング code, resolve environment and dependency issues, and investigate GPU and distributed workload failures.See Use Genie Code with AI ランタイム.
ガイド
従来のワークロードからの移行、サンプルノートブック、およびトラブルシューティングについては、 AI ランタイム のユーザーガイドを参照してください。既存の Slurm トレーニング ワークロードを AI Runtime に移行するには、 Slurm からの移行を参照してください。