Databricks 基盤モデル API
この記事では、Databricksの基盤モデルAPIの概要を説明します。これには、使用要件、サポートされているモデル、および制限が含まれています。
Databricks基盤モデルAPIとは何ですか?
モデルサービングは、サービングエンドポイントから最先端のオープンモデルにアクセスしてクエリできるようにする基盤モデルAPIsをサポートするようになりました。 これらのモデルはDatabricksによってホストされており、独自のモデルデプロイメントを管理することなく、それらを使用するアプリケーションを迅速かつ簡単に構築できます。基盤モデルAPIsはDatabricks指定サービスです。つまり、顧客コンテンツを処理するときにDatabricks Geosを使用してデータ常駐を管理します。
基盤モデル API は、次のモードで提供されます。
-
トークン単位の従量課金: これは、Databricksで基盤モデルへのアクセスを開始する最も簡単な方法であり、Foundation Model APIsの使用を開始する方におすすめです。本番運用ワークロードの場合、Databricksは、負荷がかかった状態でもより一貫したパフォーマンスを必要とする、レイテンシーに敏感なワークロード向けに、優先モードとも呼ばれる優先トークン単位の従量課金を推奨しています。
-
プロビジョニングされたスループット:このモードは、すべての本番運用ワークロード、特に高スループット、パフォーマンス保証、ファインチューニングされたモデル、または追加のセキュリティ要件が必要なワークロードに推奨されます。プロビジョニングされたスループットエンドポイントは、HIPAAなどのコンプライアンス認証を取得して利用できます。
-
AI Functionsの最適化されたモデル:このモードは、バッチ推論ワークロードに推奨されます。AI Functionsを使用して、任意のAIまたは機械学習モデルでバッチ推論をランできます。
これらのモードとサポートされているモデルの使用方法に関するガイダンスについては、 基盤モデル APIの使用を参照してください。
基盤モデル API を使用すると、以下のことを行うことができます。
- 一般化された LLM をクエリして、より多くのリソースを投資する前にプロジェクトの有効性を確認します。
- 一般化された LLM に対してクエリを実行して、LLM ベースのアプリケーションの概念実証を迅速に作成してから、トレーニングとカスタム モデルのデプロイに投資します。
- 基盤モデルとベクトル インデックスを使用して、取得拡張生成 (RAG) を使用したチャットボットを構築します。
- 独自のモデルをオープンな代替モデルに置き換えて、コストとパフォーマンスを最適化します。
- LLMを効率的に比較して、ユースケースに最適な候補を見つけたり、本番運用モデルをパフォーマンスの高いモデルに交換したりできます。
- 開発用または本番運用のLLMアプリケーションを、SLAに裏打ちされたスケーラブルなLLMサービスソリューションの上に構築し、本番環境のトラフィックの急増に対応できます。
必要条件
- エンドポイント要求を認証するためのDatabricks APIトークン。
- サーバーレスコンピュート(プロビジョニングされたスループットモデル用)。
- 次のいずれかのサポートされているリージョンのワークスペース。
基盤モデル APIの利用
基盤モデルAPIを使用するには、複数の選択肢があります。
ほとんどの基盤モデル APIs は OpenAI と互換性があるため、OpenAI クライアントを使用してクエリを実行できます。また、UI、基盤モデル APIs の Python SDK、MLflow Deployments SDK、または REST API を使用して、サポートされているモデルのクエリを実行することもできます。OpenJev モデルは、TypeSafe System One API を使用します。Databricks では、互換性のあるモデルを使用した拡張インタラクションには OpenAI クライアント SDK または API を使用し、機能を試すには UI を使用することをお勧めします。
スコアリングの例については、「 基盤モデルを使用する 」を参照してください。
トークン単位の従量課金 基盤モデル API
トークン単位の従量課金モデルを提供する事前設定されたEndpointには、Databricksワークスペースからアクセスできます。これらのトークン単位の従量課金モデルの使用開始が推奨されます。 ワークスペース でアクセスするには、ワークスペースのサイドバーで AI Gateway をクリックします。トークン単位の従量課金モデルは、システム提供のモデル サービス として[モデル]tabに一覧表示されます。システム提供のモデルサービスについては、を参照してください。

- サポートされているトークン単位の従量課金モデル。
- 基盤モデルAPIをクエリする方法については、基盤モデルの使用を参照してください。
- 必要なパラメーターと構文については、基盤モデル REST API リファレンス を参照してください。
優先トークン単位の従量課金
優先トークン単位の従量課金は、優先モードとも呼ばれ、レイテンシーに敏感なリアルタイムアプリケーション向けのトークン単位の従量課金機能です。service_tierパラメーターを"priority"に設定してリクエストを送信すると、Databricksは、標準的なベストエフォート型のトークン単位の従量課金トラフィックよりも優先してリクエストを受け付け、負荷がかかった状態でもより一貫したレイテンシーを実現できます。優先モードはリクエストごとにオプトインで、コミットメントは不要であり、トークンあたりの料金が高くなります。
「基盤モデル APIs向けの優先トークン単位の従量課金」を参照してください。
プロビジョニングされたスループット 基盤モデル API
プロビジョニングされたスループットは、パフォーマンスの保証を必要とする基盤モデルのワークロードに対してエンドポイントに最適化された推論を提供します。Databricks本番運用ワークロードにはプロビジョニング スループットを推奨します。
- プロビジョニングされたスループットは、モデルアーキテクチャをサポートしました。
- プロビジョニング済みスループットモードで基盤モデルAPIsをデプロイする方法の詳細なガイドについては、オンデマンドのプロビジョニング済み throughput 基盤モデルAPIsを参照してください。
プロビジョニングされたスループットのサポートには以下が含まれます。
- すべてのサイズのベースモデル 。 ベースモデルには、 Databricks Marketplaceを使用してアクセスするか、 Hugging Face または別の外部ソースからダウンロードして Unity Catalogに登録することもできます。 後者のアプローチは、サポートされているモデルの微調整されたバリアントで機能します。
- 基本モデルの微調整されたバリアント (独自のデータに基づいて微調整されたモデルなど)。
- 完全にカスタマイズされた重みとトークナイザー (ゼロからトレーニングされたもの、または 基本モデル アーキテクチャ (CodeLlama) を使用して事前トレーニングされたものやその他のバリエーションなど)。
バッチ推論のためのAI関数
AI関数を使用した非構造化データの変換をご覧ください。
AI Functionsを使用してバッチ推論パイプラインを作成する方法については、「バッチ推論パイプラインのデプロイ」を参照してください。
制限
基盤モデルAPIの制限を参照してください。