基盤モデル APIs の優先トークン単位の従量課金
このページでは、基盤モデル APIs のトークン単位の従量課金における優先トークン単位の従量課金について、その動作や優先リクエストの送信方法を含めて説明します。
優先トークン単位の従量課金とは何ですか?
優先トークン単位の従量課金(優先モードとも呼ばれます)は、レイテンシに敏感なリアルタイムアプリケーション向けのトークン単位の従量課金機能です。service_tierパラメーターを"priority"に設定してリクエストを送信すると、Databricksは、同じモデルの標準的なベストエフォート型トークン単位の従量課金トラフィックよりも先にリクエストを承認します。これにより、トラフィックが多い期間でも可用性がより一貫して維持されます。
優先トークン単位の従量課金はリクエストごとにオプトインであるため、同じモデルに優先リクエストと標準リクエストを送信できます。容量コミットメントは不要で、標準のトークン単位の従量課金リクエストよりも高いトークンごとのレートで課金されます。
Databricks は、次の場合に優先モードを推奨します。
- 標準のトークン単位の従量課金よりも一貫したパフォーマンスと可用性が必要ですが、専用容量にcommitする準備ができていません。
- 本番運用アプリケーションには、より高い可用性が必要です。
サポートされているモデル
以下のトークン単位の従量課金モデルは、優先モードをサポートしています。優先リクエストを送信するには、モデルの Endpoint 名を service_tier パラメーターに "priority" を設定して使用します。
以下のトークン単位の従量課金モデルは、優先モードをサポートしています。優先リクエストを送信するには、モデルの Endpoint 名を service_tier パラメーターに "priority" を設定して使用します。
パートナーモデル
プロバイダー | モデル | エンドポイント名 | 注 |
|---|---|---|---|
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
| グローバル Endpoint でのみ利用可能です。クロス地理ルーティングが必要です。 | ||
| グローバル Endpoint でのみ利用可能です。クロス地理ルーティングが必要です。 | ||
| グローバル Endpoint でのみ利用可能です。クロス地理ルーティングが必要です。 | ||
| グローバル Endpoint でのみ利用可能です。クロス地理ルーティングが必要です。 |
オープンソースモデル
プロバイダー | モデル | エンドポイント名 | 注 |
|---|---|---|---|
Alibaba Cloud |
|
|
優先トークン単位の従量課金の動作
優先トークン単位の従量課金を使用する前に、次の動作を考慮してください:
- 一貫したパフォーマンスおよび可用性。優先トークン単位の従量課金は、負荷がかかった状態でも可用性を一定に保つように設計されています。特定の初回トークンまでの時間やエンドツーエンドのレイテンシー目標を保証するものではありません。優先リクエストは、標準のトークン単位の従量課金リクエストよりも高い可用性を目標としています。Databricksでは、あるティアにおける可用性を、そのティアにおける成功したリクエスト数を入場が許可されたリクエストの合計数で割ったものとして定義しています。
- ベストエフォート容量。優先モードでは容量は予約されず、容量コミットメントもありません。
- 標準のトークン単位の従量課金にfallbackします。優先キャパシティが完全に予約済みの場合、リクエストは標準のトークン単位の従量課金の可用性で処理され、標準のトークン単位の従量課金料金で請求されます。
- トークンごとのプレミアム。優先リクエストは、標準のトークン単位の従量課金リクエストよりも高いトークン単価で課金されます。
プロビジョニングされたthroughputと比較した優先トークン単位の従量課金
優先的なトークン単位の従量課金とプロビジョニングthroughputはどちらも本番運用ワークロードを対象としていますが、それぞれ異なるトレードオフがあります:
考慮事項 | 優先トークン単位の従量課金 | プロビジョニング済みスループット |
|---|---|---|
容量 | ベストエフォート型で共有されます。 | 専用の予約済み容量。 |
Commitment | なし。リクエストごとにオプトインします。 | プロビジョニングされたEndpointが必要です。 |
可用性 | 負荷がかかった状態では、標準のトークン単位の従量課金よりも一貫性があります。 | 予約済み容量に基づいて、予測可能です。 |
請求 | 標準のトークン単位の従量課金よりも、トークンあたりの料金が高額になります。 | プロビジョニングされたモデルユニットに基づいています。 |
優先リクエストを送信
優先モードを使用するには、リクエストごとにservice_tierパラメーターを"priority"に設定します。次の例では、OpenAIクライアントを使用しています。
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
パラメーターの構文については「基盤モデル REST API リファレンス」を、その他のクエリーオプションについては「基盤モデルを使用する」を参照してください。
容量制限
各クラスターは、すべてのテナントにおいて、1分あたりの最大トークン数をサポートしています。Databricksは、オンボーディング時にテナントごとの制限を設定し、単一のテナントがすべてのクラスター容量を消費できないようにしています。ワークロードにテナントごとの制限を超える容量が必要な場合は、Databricks アカウントチームにお問い合わせください。
基盤モデル APIs の制限の詳細については、基盤モデル APIs の制限とクォータを参照してください。