基盤モデル APIの制限とクォータ
このページでは、Databricks基盤モデルAPIワークロードの制限とクォータについて説明します。
Databricks 基盤モデル API レート制限を適用して、すべてのユーザー間で信頼性の高いパフォーマンスと公平なリソース割り当てを確保します。 これらの制限は、 ワークスペース プラットフォームの層、基盤モデルの種類、および基盤モデルの展開方法によって異なります。
トークン単位の従量課金 エンドポイントのレート制限
トークン単位の従量課金エンドポイントは、トークンベースおよびクエリベースのレート制限によって管理されます。 トークンベースのレート制限は、1 分間に処理できるトークンの最大数を制御し、入力トークンと出力トークンに別々に適用されます。
- 入力トークン/分 (ITPM): 60 秒以内に処理できる入力トークンの最大数 (プロンプトから)。ITPM レート制限は、エンドポイントの入力トークンのスループットを制御します。
- 1分あたりの出力トークン数(OTPM) :60秒以内に生成できる出力トークン(モデルの応答から得られるもの)の最大数。OTPMレート制限は、エンドポイントの出力トークンのスループットを制御します。
- 時間あたりのクエリ 数: 60 分以内に処理できるクエリまたは要求の最大数。本番運用 持続的な使用パターンを持つアプリケーションの場合、 Databricks は、容量が保証されているプロビジョニング スループット エンドポイントをお勧めします。
制限の追跡と適用方法
常に最も厳しい流量制限(ITPM、OTPM、QPH)が適用されます。例えば、ITPMの上限に達していなくても、QPHまたはOTPMの上限を超えると、レート制限を受ける可能性があります。ITPMまたはOTPMのいずれかの制限に達すると、後続のリクエストに対して、リクエストが多すぎたことを示す429エラーが返されます。このメッセージは、レート制限期間がリセットされるまで表示されます。
Databricks では、次の機能を使用して、トークン/分 (TPM) のレート制限を追跡し、適用します。
機能 | 詳細 |
|---|---|
トークンアカウンティングと事前入場チェック |
|
バースト容量とスムージング |
|
以下は、入学前チェックとクレジットバック動作の仕組みの例です。
# Request with max_tokens specified
request = {
"prompt": "Write a story about...", # 10 input tokens
"max_tokens": 500 # System reserves 500 output tokens
}
# Pre-admission check:
# - Verifies 10 tokens against ITPM limit
# - Reserves 500 tokens against OTPM limit
# - If either would exceed limits, returns 429 immediately
# If admitted, actual response uses only 350 tokens
# The system credits back 150 tokens (500 - 350) to your OTPM allowance
# These 150 tokens are immediately available for other requests
モデル別のレート制限
次の表は、 Enterprise ワークスペースプラットフォームの階層 上のワークスペースにおける、トークン単位の従量課金に対応した基盤モデルAPI EndpointのITPM、OTPM、およびQPHのレート制限をまとめたものです。
provisioned throughput をサポートするモデルの場合、トークン単位の従量課金制限がユースケースの要件を満たさないときは、provisioned throughput Endpoint を作成してください。
パートナーモデルのトークンクォータレベル
パートナーモデルのトークンクォータ段階には、番号付きの3つのティアがあります。モデル固有のプロバイダー容量制限により下限が必要とされる場合を除き、パートナーモデルのdefaultはティア1です。これらのクォータティアは、ワークスペースプラットフォームのティアとは別個のものです。
クォータレベル | ITPM 制限 | OTPM 制限 | 可用性 |
|---|---|---|---|
階層 1 | 1,000,000 | 100,000 | モデル固有のプロバイダー容量例外が適用される場合を除き、パートナーモデルに自動的に適用されます。 |
階層2 | 5,000,000 | 500,000 | クォータリクエストフローで利用可能 |
階層3 | 10,000,000 | 1,000,000 | クォータリクエストフローで利用可能 |
カスタムトークンの制限には Databricks による容量レビューが必要であり、これら 3 つの階層の対象外となります。トークンクォータ階層によって変更されるのは ITPM および OTPM の制限のみであり、RPS、QPS、RPH、および QPS の制限はモデル固有のままです。パートナーモデルでは、モデル固有のプロバイダー容量の制約がある場合にのみ、より低い default が維持されます。オープンモデルでは、次の表に示す default が維持されます。
大規模言語モデル(LLM) | ITPM 制限 | OTPM 制限 | QPH 制限 |
|---|---|---|---|
GPT-6.1 Sol | 1,000,000 | 100,000 | 36万 |
GPT-6 Sol | 1,000,000 | 100,000 | 36万 |
GPT-6 Luna | 1,000,000 | 100,000 | 36万 |
GPT-6 Astra | 1,000,000 | 100,000 | 36万 |
GPT-5.6 Sol | 1,000,000 | 100,000 | 36万 |
GPT-5.6 Terra | 1,000,000 | 100,000 | 36万 |
GPT-5.6 Luna | 1,000,000 | 100,000 | 36万 |
GPT-5.5 Pro | 1,000,000 | 100,000 | 36万 |
GPT-5.5 | 1,000,000 | 100,000 | 36万 |
GPT-5.4 | 1,000,000 | 100,000 | 36万 |
GPT-5.4 mini | 1,000,000 | 100,000 | 36万 |
GPT-5.4ナノ | 1,000,000 | 100,000 | 36万 |
GPT-5.3 コーデックス | 1,000,000 | 100,000 | 36万 |
GPT-5.2 | 1,000,000 | 100,000 | 36万 |
GPT-5.1 | 1,000,000 | 100,000 | 36万 |
GPT-5 | 1,000,000 | 100,000 | 36万 |
GPT-5ミニ | 1,000,000 | 100,000 | 36万 |
GPT-5ナノ | 1,000,000 | 100,000 | 36万 |
Gemini 3.1 Flash イメージ | 1,000,000 | 100,000 | 36万 |
Gemini 3 Pro 画像 | 1,000,000 | 100,000 | 36万 |
Gemini 3.5 Flash Lite | 1,000,000 | 100,000 | 36万 |
Gemini 3.8 Flash | 1,000,000 | 100,000 | 36万 |
Gemini 3.7 Flash | 1,000,000 | 100,000 | 36万 |
Gemini 3.6 Flash | 1,000,000 | 100,000 | 36万 |
ジェミニ3.5フラッシュ | 1,000,000 | 100,000 | 36万 |
Gemini 3.1 Pro プレビュー | 1,000,000 | 100,000 | 36万 |
ジェミニ 3.1 フラッシュライト | 1,000,000 | 100,000 | 36万 |
ジェミニ3号フラッシュ | 1,000,000 | 100,000 | 36万 |
GLM 5.3 | 2,000,000 | 40,000 | 7,200 |
GLM 5.3 Flash | 2,000,000 | 40,000 | 7,200 |
GLM 5.2(レガシー) | 200,000 | 2万 | 7,200 |
OpenJev (Qwen3.5 4B) | 2,000,000 | 40,000 | 7,200 |
DeepSeek V4.1 Flash | 2,000,000 | 40,000 | 7,200 |
DeepSeek V4 Flash (0731) | 200,000 | 10,000 | |
Kimi K3 | 2,000,000 | 40,000 | |
Grok 4.6 | 1,000,000 | 100,000 | 36万 |
Grok 4.7 | 1,000,000 | 100,000 | 36万 |
Inkling(パブリックプレビュー) | 200,000 | 10,000 | 7,200 |
GPT OSS 120B | 1,000,000 | 100,000 | 36万 |
GPT OSS 20B | 1,000,000 | 100,000 | 36万 |
Gemma 3 12B | 1,000,000 | 100,000 | 36万 |
Llama 4 Maverick | 1,000,000 | 100,000 | 36万 |
Llama 3.3 70B Instruct | 1,000,000 | 100,000 | 36万 |
Anthropic Claudeモデル | ITPM 制限 | OTPM 制限 | QPH 制限 |
|---|---|---|---|
Claude Fable 5.1 | 1,000,000 | 100,000 | 36万 |
Claude Fable 5 | 1,000,000 | 100,000 | 36万 |
Claude Haiku 5.5 | 200,000 | 2万 | 36万 |
クロード・ハイク 4.5 | 1,000,000 | 100,000 | 36万 |
Claude Opus 5 | 1,000,000 | 100,000 | 36万 |
Claude Opus 5.5 | 1,000,000 | 100,000 | 36万 |
Claude Opus 4.8 | 1,000,000 | 100,000 | 36万 |
Claude Opus 4.7 | 1,000,000 | 100,000 | 36万 |
クロード・オプス 4.6 | 1,000,000 | 100,000 | 36万 |
クロード・オプス 4.5 | 1,000,000 | 100,000 | 36万 |
クロード・オプス 4.1 | 1,000,000 | 100,000 | 36万 |
Claude Sonnet 5 | 1,000,000 | 100,000 | 36万 |
Claude Sonnet 5.5 | 1,000,000 | 100,000 | 36万 |
クロード・ソネット 4.6 | 1,000,000 | 100,000 | 36万 |
クロード・ソネット 4.5 | 1,000,000 | 100,000 | 36万 |
埋め込みモデル | ITPM 制限 | OTPM 制限 | QPH 制限 |
|---|---|---|---|
Qwen3-埋め込み-0.6B | N/A | N/A | 2,160,000 |
GTE Large (En) | N/A | N/A | 540,000 |
BGE Large (En) | N/A | N/A | 2,160,000 |
TPMレート制限を管理するためのベストプラクティス
ステップ 1.トークンの使用状況を監視する
アプリケーションで入力トークン数と出力トークン数の両方を個別に追跡します。
# Example: Track token usage
response = model.generate(prompt)
input_tokens = response.usage.prompt_tokens
output_tokens = response.usage.completion_tokens
total_tokens = response.usage.total_tokens
# Check against limits
if input_tokens > ITPM_LIMIT or output_tokens > OTPM_LIMIT:
# Implement backoff strategy
pass
ステップ2:リトライロジックを実装する
レート制限エラーが発生した場合に指数バックオフを追加します。
import time
import random
def retry_with_exponential_backoff(
func,
initial_delay: float = 1,
exponential_base: float = 2,
jitter: bool = True,
max_retries: int = 10,
):
"""Retry a function with exponential backoff."""
num_retries = 0
delay = initial_delay
while num_retries < max_retries:
try:
return func()
except Exception as e:
if "rate_limit" in str(e) or "429" in str(e):
num_retries += 1
if jitter:
delay *= exponential_base * (1 + random.random())
else:
delay *= exponential_base
time.sleep(delay)
else:
raise e
raise Exception(f"Maximum retries {max_retries} exceeded")
ステップ 3.トークンの使用を最適化する
- プロンプトの長さを最小限に抑える : 簡潔で構造化されたプロンプトを使用する
- 出力長の制御 :
max_tokensパラメーターを使用して応答サイズを制限します - 効率的なバッチ処理 : 制限内に収まりながら、可能な場合は関連する要求をグループ化します
ステップ 4.モデル選択を検討する
- 高ボリュームタスク向けの小型モデル : より高い throughput を必要とするタスクには、GPT OSS 20B のようなモデルを使用します。
- 複雑なタスク向けの大規模モデル :最大限の能力を必要とするタスクには GPT OSS 120B を確保してください。
モニタリングとトラブルシューティング
トークンの使用パターンを監視して、パフォーマンスを最適化します。
# Example: Log token usage for monitoring
import logging
logger = logging.getLogger(__name__)
def log_token_usage(response):
usage = response.usage
logger.info(f"Input tokens: {usage.prompt_tokens}")
logger.info(f"Output tokens: {usage.completion_tokens}")
logger.info(f"Total tokens: {usage.total_tokens}")
# Alert if approaching limits
if usage.prompt_tokens > ITPM_LIMIT * 0.8:
logger.warning("Approaching ITPM limit")
if usage.completion_tokens > OTPM_LIMIT * 0.8:
logger.warning("Approaching OTPM limit")
レート制限エラーの処理
レート制限を超えると、API は 429 Too Many Requests エラーを返します。
{
"error": {
"message": "Rate limit exceeded: ITPM limit of 1,000,000 tokens reached",
"type": "rate_limit_exceeded",
"code": 429,
"limit_type": "input_tokens_per_minute",
"limit": 1000000,
"current": 1000150,
"retry_after": 15
}
}
エラー応答には次のものが含まれます。
limit_type: どの特定の制限を超えたか (ITPM、OTPM、QPS、または QPH)limit:設定された制限値current:現在の使用状況retry_after: 推奨待ち時間 (秒単位)
サービス容量エラーの処理
429 Too Many Requests エラーは、ワークロードがお客様の管理下にあるレート制限を超過したことを意味します。503 Service Unavailable エラーは異なります。基盤モデル APIs が一時的に容量に達し、リクエストを処理できなかったことを意味します。503 エラーは、独自のレート制限に達したことを示すものではなく、それに数えられません。
ステップ 2. リトライロジックの実装と同じパターンに従って、503 レスポンスを一時的なものとして扱い、エクスポネンシャル バックオフで再試行します。一貫した容量を必要とする本番運用ワークロードの場合は、共有のトークン単位の従量課金容量ではなく専用の容量を提供するプロビジョニング済みthroughputを使用します。サポートされている基盤モデルについては、予約済みプロビジョニング済み throughputおよびオンデマンド プロビジョニング済み throughputに関するドキュメントを参照してください。
一般的な問題とソリューション
問題 | ソリューション |
|---|---|
頻繁な 429 エラー | 指数バックオフの実装、要求レートの削減、より高いレート制限の要求 |
ITPM 制限に達しました | プロンプトの長さを最適化する |
OTPM 制限に達しました |
|
QPH 制限に達しました | 時間の経過とともに要求をより均等に分散する |
503 サービス Unavailable | 指数関数的バックオフで再試行します。一貫した本番運用キャパシティが必要な場合は、プロビジョニング済みthroughputを使用します |
プロビジョニングされたスループットの制限
より高い制限を必要とする本番運用ワークロードの場合、プロビジョニング スループット エンドポイントは以下を提供します。
- TPM 制限なし : プロビジョニングされたリソースに基づく処理容量
- より高いレート制限 : ワークスペースごとに最大 200 クエリ/秒
- 予測可能なパフォーマンス : 専用リソースにより、一貫した待機時間が確保されます
出力トークンの制限
以下の表は、サポートされている各モデルの出力トークン制限をまとめたものです。
モデル | 出力トークンの制限 |
|---|---|
GPT OSS 120B | 25,000 |
GPT OSS 20B | 25,000 |
Gemma 3 12B | 8,192 |
Llama 4 Maverick | 8,192 |
Llama 3.1 70B | 8,192 |
Llama 3.1 8B | 8,192 |
追加の制限
プロビジョニングされたスループットワークロードの制限は次のとおりです。
- GTE Large (En) 埋め込みモデルでは、正規化された埋め込みは生成されません。
- Llama 4 Maverick を使用するプロビジョニングされたスループットワークロードの場合:
- プロビジョニングされたスループット ワークロードでのこのモデルのサポートは、 パブリック プレビュー段階です。
- オートスケールはサポートされていません。
- メトリクスパネルはサポートされていません。
- トラフィック分割は、Llama 4 Maverick にサービスを提供するエンドポイントではサポートされていません。Llama 4 Maverick を提供するエンドポイントで複数のモデルを提供することはできません。
地域別の可用性とデータ処理
Databricksがホストする 基盤モデルのリージョン可用性については、「基盤モデルの概要」を参照してください。
データ処理と常駐の詳細については、「 データ処理と常駐」を参照してください。
基盤モデルおよび外部モデルのリソースとペイロード制限
次の表は、基盤モデルと外部モデルを提供するエンドポイントのリソースとペイロードの制限をまとめたものです。
機能 | 粒度 | 上限 |
|---|---|---|
ペイロードサイズ | リクエストに応じて | 4MB |
1秒間に処理できるクエリー数(QPS) | ワークスペースごと | 200 |
モデル実行期間 | リクエストに応じて | 597秒 |
オーバーヘッドレイテンシ | リクエストに応じて | 50ミリ秒未満 |