メインコンテンツまでスキップ

概要

備考

プレビュー

この機能は パブリック プレビュー段階です。

AI Runtimeは、ディープラーニングワークロードを目的としたDatabricksコンピュート オファリングであり、 Databricksサーバレスに GPU サポートをもたらします。 AI Runtimeを使用すると、お気に入りのフレームワークを使用してカスタム モデルをトレーニングしたり微調整したりすることができ、最先端の効率、パフォーマンス、品質を得ることができます。 サーバレス コンピュートがDatabricksアーキテクチャにどのように適合するかの概要については、 「 サーバレス ワークスペース アーキテクチャ 」を参照してください。

主な機能

AI Runtimeは、マネージドGPUインフラストラクチャとディープラーニング向けに構築されたランタイムを組み合わせたものです。

  • フルマネージド GPU インフラストラクチャ : Serverless、GPU への柔軟なアクセス、クラスター構成、ドライバー選択、オートスケーリングポリシーの管理は不要です。
  • ディープラーニング専用ランタイム :依存関係に対する柔軟性を最大限に高める最小限のStandard環境か、人気の機械学習フレームワークがプリロードされたフル機能のAI環境のいずれかを選択します。
  • ノートブック、ジョブ、Unity Catalog、MLflow間で ネイティブに統合 されており、シームレスな開発、データアクセス、エクスペリメントのトラッキングを実現します。

ハードウェアオプション

すべてのAI Runtimeアクセラレータは単一のノードをプロビジョニングします。そのノード上のGPU数は、アクセラレータのタイプによって異なります。

アクセラレータ

GPUs per node

GPU memory

どのようなタスクにベストなのか

分散学習

1xA10

1

24GB

クラシックな機械学習モデルや小規模言語モデルのファインチューニングなど、中小規模の機械学習およびディープラーニングタスク

サポートされていません(シングルGPU)

1xH100

1

80GB

1xA10よりも多くのGPUメモリを必要とするが、中規模言語モデルのファインチューニングなどのマルチGPU分散トレーニングを必要としないワークロード

サポートされていません(シングルGPU)

8xH100

8

GPU あたり 80GB

大規模モデルのトレーニングやファインチューニング、高度なディープラーニングタスクの実行などの大規模なAIワークロード

@distributedデコレータを使用したサポート gpus=8

アクセラレータ

GPUs per node

GPU memory

どのようなタスクにベストなのか

分散学習

1xA10

1

24GB

クラシックな機械学習モデルや小規模言語モデルのファインチューニングなど、中小規模の機械学習およびディープラーニングタスク

サポートされていません(シングルGPU)

1xH100

1

80GB

1xA10よりも多くのGPUメモリを必要とするが、中規模言語モデルのファインチューニングなどのマルチGPU分散トレーニングを必要としないワークロード

サポートされていません(シングルGPU)

8xH100

8

GPU あたり 80GB

大規模モデルのトレーニングやファインチューニング、高度なディープラーニングタスクの実行などの大規模なAIワークロード

@distributedデコレータを使用したサポート gpus=8

ヒント

マルチGPU分散トレーニングをサポートしているのは 8xH100 のみです。シングルGPUワークロードの場合は、モデルに必要なGPUメモリに応じて 1xA10 または 1xH100 を選択してください。

推奨されるユースケース

Databricks recommends AI Runtime for any custom model training use cases that involve ディープラーニング, large-scale classic workloads, or GPUs.

例えば:

  • LLM ファインチューニング(LoRA、QLoRA、フル ファインチューニング)
  • コンピュータビジョン(オブジェクト検出、画像分類)
  • ディープラーニングベースのレコメンデーションシステム
  • 強化学習
  • ディープラーニングベースの時系列予測

要件

Before you 起動, confirm your ワークスペース meets these requirements:

  • AWS がサポートする次のいずれかのリージョンにあるワークスペース:

    • us-west-2
    • us-west-1
    • us-east-1
    • us-east-2
    • ca-central-1
    • sa-east-1
  • AI Runtimeのプレビューは、ワークスペース管理者の設定から有効にする必要があります。Databricks プレビューの管理を参照してください。

制限事項

AI ランタイムワークロードを計画する際は、以下の制限事項に注意してください。

  • AI ランタイムでは、A10およびH100アクセラレータのみがサポートされています。
  • AI ランタイム doesn't support the コンプライアンス security profile for the FedRAMP High or DoD IL5 standards.
  • Adding dependencies using the Environments panel is not supported for AI ランタイム scheduled ジョブ.Install dependencies programmatically using %pip install in your notebook instead.
  • AI Runtime上のスケジュールされたジョブでは、ノートブックに関連付けられている互換性のないパッケージバージョンの自動リカバリ動作はサポートされていません。
  • AI ランタイムの接続試行は、対話型ノートブックの場合は15分後、ノートブックジョブまたはCLIジョブの場合は24時間後にタイムアウトします。接続されたノートブックセッションおよびノートブックジョブは最大2日間実行でき、CLIジョブは最大14日間実行できます。長時間実行されるモデルのトレーニングジョブでは、チェックポイントを実装し、最大ランタイムに達したときにジョブを再起動してください。
  • AI Runtimeは、GPU リソースへのオンデマンド アクセスを提供します。 これによりGPUへの容易かつ柔軟なアクセスが可能になりますが、お住まいの地域では容量が制限されたり、利用できなくなる期間が生じる可能性があります。
  • AI Runtimeは、需要が高い状況において、特定のケースでリージョンをまたいだGPUを活用します。このような利用にはエグレスコストが発生する場合があり、特定の時間帯にはリージョン間のネットワーク接続が制限される可能性があります。

AI ランタイムへの接続

You can connect to AI ランタイム interactively from ノートブックs, an IDE terminal using an SSH tunnel, scheduled ジョブs, the ジョブ API, and Declarative Automation Bundles.For step-by-step instructions, see Connect to AI ランタイム.

環境の設定

AI ランタイムは、2つのマネージドPython環境(最小限のStandard環境と、PyTorchやTransformersなどの人気の機械学習フレームワークがプリロードされたフル機能のDatabricks AI環境)を提供します。環境の選択、キャッシュの動作、カスタムモジュールのインポート、既知の制限事項の詳細については、「環境の設定」を参照してください。

ヒント

依存関係スタックを完全に制御するには Standard 環境を選択し、PyTorchやTransformersなどの一般的なフレームワークのインストールをスキップするには Databricks AI 環境を選択します。

AI ランタイムへのデータの読み込み

AI Runtimeにおけるデータアクセスの仕組みを理解することは、スムーズな操作性を実現するために不可欠です。 詳細については、 AI Runtimeへのデータの読み込みを参照してください。

分散トレーニング

AI Runtimeは、ノートブックが接続されている単一ノード上の複数のGPUにわたる分散トレーニングをサポートしています。serverless_gpu Python APIの@distributedデコレーターを使用すると、最小限の設定でPyTorch DDP、FSDP、またはDeepSpeedを使用したマルチGPUワークロードを起動できます。詳細については、ノートブックでの分散トレーニングを参照してください。

ヒント

@distributed デコレータを使用して 8xH100 にスケールアップする前に、単一のGPUでワークロードを検証します。

AI Runtime上のRay

AI ランタイム は、Ray Core、Ray Data、Ray Train、Ray Tune をはじめとする、分散 GPU ワークロード向けの Ray をサポートしています。クラスターを設定することなく、Serverless GPU コンピュートでシングルノードおよびマルチノードの Ray ジョブを実行できます。詳細と例については、Ray on AI ランタイム を参照してください。

実験の追跡と観察可能性

MLflow統合、ログの表示、モデルチェックポイントの管理については、拡張機能の追跡と可観測性を参照してください。

トレーニング ワークロードの本番運用

Declarative Automation Bundlesを使用してAI Runtimeワークロードをデプロイし、独自のトレーニングコードを実行したり、GPUタスクとCPUタスクを組み合わせたマルチタスクジョブを構築したり、パイプラインをスケジュールしたり、開発から本番運用へ昇格させたりできます。トレーニングワークロードの本番運用を参照してください。

ディープラーニングのためのGenie Code

Genie Code can help develop and troubleshoot ディープラーニング workloads on AI ランタイム.It can generate distributed トレーニング code, resolve environment and dependency issues, and investigate GPU and distributed workload failures.See Use Genie Code with AI ランタイム.

ガイド

従来のワークロードからの移行、サンプルノートブック、およびトラブルシューティングについては、 AI Runtime のユーザーガイドを参照してください。