AI Runtime
備考
プレビュー
この機能は パブリック プレビュー段階です。
AI ランタイムは、ディープラーニングワークロードを目的としたDatabricksのServerless GPU コンピュートオファリングです。AI ランタイムを使用すると、お気に入りのフレームワークを使用してカスタムモデルをトレーニングおよびファインチューニングし、最先端の効率、パフォーマンス、品質を得ることができます。
使ってみる
クイックスタートガイドを使用して、数分で最初のワークロードを実行します。
-
- 🚀 Databricks CLI クイックスタート
- SlurmまたはKubernetesクラスターをお使いですか?ターミナルから数分でAI ランタイム上でトレーニングする。
-
- 📓 ノートブックのクイックスタート
- ノートブックを数秒でGPUにアタッチし、インタラクティブに開発します。
-
- ⚡ Ray
- Coming from a Ray cluster?ラン Ray on AI ランタイム with dashboard support.
-
- 🧭 概要
- Learn the key things about AI ランタイム in two minutes: available GPUs, how it works, and limitations.
特徴量
AI Runtimeは、GPUへの多数の接続方法、組み込みのオブザーバビリティおよびデバッグツール、事前構築済みの環境を備えたフルスタックGPUプラットフォームです。
Serverless GPUへの接続 :どこからでもServerless GPUにアクセスできます。
-
- ノートブック
- Serverless GPUコンピュートにノートブックをアタッチし、クラスターの設定なしでインタラクティブに開発します。
-
- SSH 経由のIDE
- IDEまたはターミナルからSSHトンネル経由で接続し、GPUノードを直接操作します。
-
- Databricks CLI
- YAMLジョブ構成を使用して、ノートパソコンから分散GPUトレーニングジョブを送信および管理します。
-
- AI エージェント
databricks-ai-runtimeエージェントスキルを使用して、AI エージェントから GPU トレーニングジョブを送信、監視、および管理します。
-
- Ray
- ラン Ray Core, Ray Data, Ray トレーニングする, and Ray Tune on Serverless GPU コンピュート.
依存関係の管理 : ワークロードの実行に使用するPythonおよびシステムのライブラリを制御します。
-
- Pre-built environments
- 最小限のStandard環境、または機械学習フレームワークがプリロードされたDatabricks AI環境から開始します。
GPUへのデータの読み込み :トレーニングデータをGPUに効率的にフィードします。
-
- 効率的なデータローダー
- 高いGPU稼働率を実現するために構築されたフォールトトレラントなローダーを使用して、Unity Catalogボリュームからデータをストリームします。
デバッグとオブザーバビリティ :エクスペリメントの追跡、出力の検査、障害の診断を行います。
-
- ディープラーニングのためのMLflow
- MLflow を使用して、エクスペリメント、メトリクス、ランを追跡します。
-
- Logsビューア
- コードの実行中にトレーニングの出力を確認し、GPUリソースの使用状況を監視します。
-
- エージェントによるデバッグ
- Genie Codeを使用してトレーニングコードを生成し、環境の問題を解決し、GPU障害をデバッグします。
スケジュールとリアルタイムサービング :インタラクティブな開発から、スケジュールされたジョブやEndpointへと移行します。
-
- GPUワークロードのスケジュール
- 宣言型オートメーションバンドルを使用してトレーニングコードをデプロイし、ランのスケジュールを設定し、マルチタスクのGPUおよびCPUワークフローを構築します。
-
- モデルをサービングする
- Model Serving を使用して、トレーニング済みモデルをスケーラブルな Endpoint の背後にデプロイします。
例
Clone end-to-end examples and ラン them on AI ランタイム in minutes, from the CLI or in ノートブック.
-
- 従来のMachine Learning
- GPU アクセラレーションによる XGBoost、ゼロショット表形式予測、時系列予測。
-
- レコメンデーションシステム
- Two-Tower アーキテクチャなどのディープラーニング レコメンデーション モデルをトレーニングする。
-
- コンピュータビジョン
- GPU でのオブジェクト検出および画像分類ワークロード。
-
- オープンソース モデル(LLM)の事後トレーニング
- LoRA、フルファインチューニング、および TRL、Unsloth、Axolotl などのライブラリを使用したオープンソース LLM のファインチューニングと事後トレーニング。
-
- バッチ推論
- Ray Data と vLLM を使用して、複数の GPU にわたって大規模なバッチ推論を実行します。
-
- マルチGPU分散トレーニング
- DDP、FSDP、DeepSpeed を使用して、複数の GPU とノードにわたってトレーニングをスケールします。
ガイド
ワークロードを AI Runtime に移行し、GPU を最大限に活用するためのタスク指向ガイド。
-
- Slurm からの移行
- Slurm バッチ スクリプト、分散ランチャー、および共有ストレージを Databricks CLI にマッピングします。
-
- 従来のGPUワークロードを移行する
- 既存のディープラーニング ワークロードを従来の Databricks クラスターから AI ランタイムに移行します。
-
- パフォーマンスと回復力
- トレーニングのthroughputを向上させ、長時間実行されるジョブの障害耐性を高めます。
その他のリソース
役立つコンテンツの検索: 最新の製品アップデートと、AI ランタイム の内部の仕組み。
-
- 製品のアップデート
- See the latest AI ランタイム 製品 updates and announcements.
-
- How AI ランタイム works under the hood
- Databricks がどのように AI ランタイム 全体で GPU の信頼性を維持しているかをご覧ください。