メインコンテンツまでスキップ

AI Runtime

備考

プレビュー

この機能は パブリック プレビュー段階です。

AI ランタイムは、ディープラーニングワークロードを目的としたDatabricksのServerless GPU コンピュートオファリングです。AI ランタイムを使用すると、お気に入りのフレームワークを使用してカスタムモデルをトレーニングおよびファインチューニングし、最先端の効率、パフォーマンス、品質を得ることができます。

使ってみる​

クイックスタートガイドを使用して、数分で最初のワークロードを実行します。

特徴量​

AI Runtimeは、GPUへの多数の接続方法、組み込みのオブザーバビリティおよびデバッグツール、事前構築済みの環境を備えたフルスタックGPUプラットフォームです。

Serverless GPUへの接続 :どこからでもServerless GPUにアクセスできます。

    • ノートブック
    • Serverless GPUコンピュートにノートブックをアタッチし、クラスターの設定なしでインタラクティブに開発します。
    • SSH 経由のIDE
    • IDEまたはターミナルからSSHトンネル経由で接続し、GPUノードを直接操作します。
    • Databricks CLI
    • YAMLジョブ構成を使用して、ノートパソコンから分散GPUトレーニングジョブを送信および管理します。
    • AI エージェント
    • databricks-ai-runtime エージェントスキルを使用して、AI エージェントから GPU トレーニングジョブを送信、監視、および管理します。
    • Ray
    • ラン Ray Core, Ray Data, Ray トレーニングする, and Ray Tune on Serverless GPU コンピュート.

依存関係の管理 : ワークロードの実行に使用するPythonおよびシステムのライブラリを制御します。

    • Pre-built environments
    • 最小限のStandard環境、または機械学習フレームワークがプリロードされたDatabricks AI環境から開始します。

GPUへのデータの読み込み :トレーニングデータをGPUに効率的にフィードします。

    • 効率的なデータローダー
    • 高いGPU稼働率を実現するために構築されたフォールトトレラントなローダーを使用して、Unity Catalogボリュームからデータをストリームします。

デバッグとオブザーバビリティ :エクスペリメントの追跡、出力の検査、障害の診断を行います。

スケジュールとリアルタイムサービング :インタラクティブな開発から、スケジュールされたジョブやEndpointへと移行します。

    • GPUワークロードのスケジュール
    • 宣言型オートメーションバンドルを使用してトレーニングコードをデプロイし、ランのスケジュールを設定し、マルチタスクのGPUおよびCPUワークフローを構築します。
    • モデルをサービングする
    • Model Serving を使用して、トレーニング済みモデルをスケーラブルな Endpoint の背後にデプロイします。

例​

Clone end-to-end examples and ラン them on AI ランタイム in minutes, from the CLI or in ノートブック.

ガイド​

ワークロードを AI Runtime に移行し、GPU を最大限に活用するためのタスク指向ガイド。

    • Slurm からの移行
    • Slurm バッチ スクリプト、分散ランチャー、および共有ストレージを Databricks CLI にマッピングします。

その他のリソース​

役立つコンテンツの検索: 最新の製品アップデートと、AI ランタイム の内部の仕組み。