メインコンテンツまでスキップ

基盤モデル APIの制限とクォータ

このページでは、Databricks基盤モデルAPIワークロードの制限とクォータについて説明します。

Databricks 基盤モデル API レート制限を適用して、すべてのユーザー間で信頼性の高いパフォーマンスと公平なリソース割り当てを確保します。 これらの制限は、 ワークスペース プラットフォームの層、基盤モデルの種類、および基盤モデルの展開方法によって異なります。

トークン単位の従量課金 エンドポイントのレート制限​

トークン単位の従量課金エンドポイントは、トークンベースおよびクエリベースのレート制限によって管理されます。 トークンベースのレート制限は、1 分間に処理できるトークンの最大数を制御し、入力トークンと出力トークンに別々に適用されます。

  • 入力トークン/分 (ITPM): 60 秒以内に処理できる入力トークンの最大数 (プロンプトから)。ITPM レート制限は、エンドポイントの入力トークンのスループットを制御します。
  • 1分あたりの出力トークン数(OTPM) :60秒以内に生成できる出力トークン(モデルの応答から得られるもの)の最大数。OTPMレート制限は、エンドポイントの出力トークンのスループットを制御します。
  • 時間あたりのクエリ 数: 60 分以内に処理できるクエリまたは要求の最大数。本番運用 持続的な使用パターンを持つアプリケーションの場合、 Databricks は、容量が保証されているプロビジョニング スループット エンドポイントをお勧めします。

制限の追跡と適用方法​

常に最も厳しい流量制限(ITPM、OTPM、QPH)が適用されます。例えば、ITPMの上限に達していなくても、QPHまたはOTPMの上限を超えると、レート制限を受ける可能性があります。ITPMまたはOTPMのいずれかの制限に達すると、後続のリクエストに対して、リクエストが多すぎたことを示す429エラーが返されます。このメッセージは、レート制限期間がリセットされるまで表示されます。

Databricks では、次の機能を使用して、トークン/分 (TPM) のレート制限を追跡し、適用します。

機能

詳細

トークンアカウンティングと事前入場チェック

  • 入力トークンのカウント: 入力トークンは、リクエスト時の実際のプロンプトからカウントされます。
  • 出力トークンの推定 : 要求で max_tokens を指定すると、Databricks はこの値を使用して、要求が処理のために許可される 前に 出力トークンの容量を見積もり、予約します。
  • 事前の許可検証 : Databricks は、処理を開始する前に、要求が ITPM または OTPM の制限を超えるかどうかを確認します。max_tokens OTPM 制限を超える場合、Databricks は 429 エラーで要求をすぐに拒否します。
  • 実際の出力と推定出力 : 応答が生成された後、実際の出力トークンがカウントされます。 重要なのは、実際のトークン使用量が予約 max_tokensより少ない場合、 Databricks 差額をレート制限許容量に返金 し、それらのトークンを他のリクエストにすぐに利用できるようにします。
  • max_tokens指定なし : max_tokensを指定しない場合、 Databricks は デフォルト 予約を使用し、実際のトークン数は生成後に調整されます。

バースト容量とスムージング

  • バースト バッファ:レート リ ミッタには、公称レートを超えるトラフィックの短いバーストに対応するための小さなバッファが含まれています。
  • スライディング ウィンドウ : トークンの消費は、毎分のハード境界よりもスムーズなレート制限を提供するスライディング ウィンドウ アルゴリズムを使用して追跡されます。
  • トークン バケット アルゴリズム : Databricks は、トークン バケット実装を使用して、時間の経過とともに平均レート制限を維持しながら、ある程度のバースト容量を可能にします。

機能

詳細

トークンアカウンティングと事前入場チェック

  • 入力トークンのカウント: 入力トークンは、リクエスト時の実際のプロンプトからカウントされます。
  • 出力トークンの推定 : 要求で max_tokens を指定すると、Databricks はこの値を使用して、要求が処理のために許可される 前に 出力トークンの容量を見積もり、予約します。
  • 事前の許可検証 : Databricks は、処理を開始する前に、要求が ITPM または OTPM の制限を超えるかどうかを確認します。max_tokens OTPM 制限を超える場合、Databricks は 429 エラーで要求をすぐに拒否します。
  • 実際の出力と推定出力 : 応答が生成された後、実際の出力トークンがカウントされます。 重要なのは、実際のトークン使用量が予約 max_tokensより少ない場合、 Databricks 差額をレート制限許容量に返金 し、それらのトークンを他のリクエストにすぐに利用できるようにします。
  • max_tokens指定なし : max_tokensを指定しない場合、 Databricks は デフォルト 予約を使用し、実際のトークン数は生成後に調整されます。

バースト容量とスムージング

  • バースト バッファ:レート リ ミッタには、公称レートを超えるトラフィックの短いバーストに対応するための小さなバッファが含まれています。
  • スライディング ウィンドウ : トークンの消費は、毎分のハード境界よりもスムーズなレート制限を提供するスライディング ウィンドウ アルゴリズムを使用して追跡されます。
  • トークン バケット アルゴリズム : Databricks は、トークン バケット実装を使用して、時間の経過とともに平均レート制限を維持しながら、ある程度のバースト容量を可能にします。

以下は、入学前チェックとクレジットバック動作の仕組みの例です。

Python
# Request with max_tokens specified
request = {
"prompt": "Write a story about...", # 10 input tokens
"max_tokens": 500 # System reserves 500 output tokens
}

# Pre-admission check:
# - Verifies 10 tokens against ITPM limit
# - Reserves 500 tokens against OTPM limit
# - If either would exceed limits, returns 429 immediately

# If admitted, actual response uses only 350 tokens
# The system credits back 150 tokens (500 - 350) to your OTPM allowance
# These 150 tokens are immediately available for other requests

モデル別のレート制限​

次の表は、 Enterprise ワークスペースプラットフォームの階層 上のワークスペースにおける、トークン単位の従量課金に対応した基盤モデルAPI EndpointのITPM、OTPM、およびQPHのレート制限をまとめたものです。

注記

provisioned throughput をサポートするモデルの場合、トークン単位の従量課金制限がユースケースの要件を満たさないときは、provisioned throughput Endpoint を作成してください。

パートナーモデルのトークンクォータレベル​

パートナーモデルのトークンクォータ段階には、番号付きの3つのティアがあります。モデル固有のプロバイダー容量制限により下限が必要とされる場合を除き、パートナーモデルのdefaultはティア1です。これらのクォータティアは、ワークスペースプラットフォームのティアとは別個のものです。

クォータレベル

ITPM 制限

OTPM 制限

可用性

階層 1

1,000,000

100,000

モデル固有のプロバイダー容量例外が適用される場合を除き、パートナーモデルに自動的に適用されます。

階層2

5,000,000

500,000

クォータリクエストフローで利用可能

階層3

10,000,000

1,000,000

クォータリクエストフローで利用可能

クォータレベル

ITPM 制限

OTPM 制限

可用性

階層 1

1,000,000

100,000

モデル固有のプロバイダー容量例外が適用される場合を除き、パートナーモデルに自動的に適用されます。

階層2

5,000,000

500,000

クォータリクエストフローで利用可能

階層3

10,000,000

1,000,000

クォータリクエストフローで利用可能

カスタムトークンの制限には Databricks による容量レビューが必要であり、これら 3 つの階層の対象外となります。トークンクォータ階層によって変更されるのは ITPM および OTPM の制限のみであり、RPS、QPS、RPH、および QPS の制限はモデル固有のままです。パートナーモデルでは、モデル固有のプロバイダー容量の制約がある場合にのみ、より低い default が維持されます。オープンモデルでは、次の表に示す default が維持されます。

注記

大規模言語モデル(LLM)

ITPM 制限

OTPM 制限

QPH 制限

GPT-6.1 Sol

1,000,000

100,000

36万

GPT-6 Sol

1,000,000

100,000

36万

GPT-6 Luna

1,000,000

100,000

36万

GPT-6 Astra

1,000,000

100,000

36万

GPT-5.6 Sol

1,000,000

100,000

36万

GPT-5.6 Terra

1,000,000

100,000

36万

GPT-5.6 Luna

1,000,000

100,000

36万

GPT-5.5 Pro

1,000,000

100,000

36万

GPT-5.5

1,000,000

100,000

36万

GPT-5.4

1,000,000

100,000

36万

GPT-5.4 mini

1,000,000

100,000

36万

GPT-5.4ナノ

1,000,000

100,000

36万

GPT-5.3 コーデックス

1,000,000

100,000

36万

GPT-5.2

1,000,000

100,000

36万

GPT-5.1

1,000,000

100,000

36万

GPT-5

1,000,000

100,000

36万

GPT-5ミニ

1,000,000

100,000

36万

GPT-5ナノ

1,000,000

100,000

36万

Gemini 3.1 Flash イメージ

1,000,000

100,000

36万

Gemini 3 Pro 画像

1,000,000

100,000

36万

Gemini 3.5 Flash Lite

1,000,000

100,000

36万

Gemini 3.8 Flash

1,000,000

100,000

36万

Gemini 3.7 Flash

1,000,000

100,000

36万

Gemini 3.6 Flash

1,000,000

100,000

36万

ジェミニ3.5フラッシュ

1,000,000

100,000

36万

Gemini 3.1 Pro プレビュー

1,000,000

100,000

36万

ジェミニ 3.1 フラッシュライト

1,000,000

100,000

36万

ジェミニ3号フラッシュ

1,000,000

100,000

36万

GLM 5.3

2,000,000

40,000

7,200

GLM 5.3 Flash

2,000,000

40,000

7,200

GLM 5.2(レガシー)

200,000

2万

7,200

OpenJev (Qwen3.5 4B)

2,000,000

40,000

7,200

DeepSeek V4.1 Flash

2,000,000

40,000

7,200

DeepSeek V4 Flash (0731)

200,000

10,000

Kimi K3

2,000,000

40,000

Grok 4.6

1,000,000

100,000

36万

Grok 4.7

1,000,000

100,000

36万

Inkling(パブリックプレビュー)

200,000

10,000

7,200

GPT OSS 120B

1,000,000

100,000

36万

GPT OSS 20B

1,000,000

100,000

36万

Gemma 3 12B

1,000,000

100,000

36万

Llama 4 Maverick

1,000,000

100,000

36万

Llama 3.3 70B Instruct

1,000,000

100,000

36万

大規模言語モデル(LLM)

ITPM 制限

OTPM 制限

QPH 制限

GPT-6.1 Sol

1,000,000

100,000

36万

GPT-6 Sol

1,000,000

100,000

36万

GPT-6 Luna

1,000,000

100,000

36万

GPT-6 Astra

1,000,000

100,000

36万

GPT-5.6 Sol

1,000,000

100,000

36万

GPT-5.6 Terra

1,000,000

100,000

36万

GPT-5.6 Luna

1,000,000

100,000

36万

GPT-5.5 Pro

1,000,000

100,000

36万

GPT-5.5

1,000,000

100,000

36万

GPT-5.4

1,000,000

100,000

36万

GPT-5.4 mini

1,000,000

100,000

36万

GPT-5.4ナノ

1,000,000

100,000

36万

GPT-5.3 コーデックス

1,000,000

100,000

36万

GPT-5.2

1,000,000

100,000

36万

GPT-5.1

1,000,000

100,000

36万

GPT-5

1,000,000

100,000

36万

GPT-5ミニ

1,000,000

100,000

36万

GPT-5ナノ

1,000,000

100,000

36万

Gemini 3.1 Flash イメージ

1,000,000

100,000

36万

Gemini 3 Pro 画像

1,000,000

100,000

36万

Gemini 3.5 Flash Lite

1,000,000

100,000

36万

Gemini 3.8 Flash

1,000,000

100,000

36万

Gemini 3.7 Flash

1,000,000

100,000

36万

Gemini 3.6 Flash

1,000,000

100,000

36万

ジェミニ3.5フラッシュ

1,000,000

100,000

36万

Gemini 3.1 Pro プレビュー

1,000,000

100,000

36万

ジェミニ 3.1 フラッシュライト

1,000,000

100,000

36万

ジェミニ3号フラッシュ

1,000,000

100,000

36万

GLM 5.3

2,000,000

40,000

7,200

GLM 5.3 Flash

2,000,000

40,000

7,200

GLM 5.2(レガシー)

200,000

2万

7,200

OpenJev (Qwen3.5 4B)

2,000,000

40,000

7,200

DeepSeek V4.1 Flash

2,000,000

40,000

7,200

DeepSeek V4 Flash (0731)

200,000

10,000

Kimi K3

2,000,000

40,000

Grok 4.6

1,000,000

100,000

36万

Grok 4.7

1,000,000

100,000

36万

Inkling(パブリックプレビュー)

200,000

10,000

7,200

GPT OSS 120B

1,000,000

100,000

36万

GPT OSS 20B

1,000,000

100,000

36万

Gemma 3 12B

1,000,000

100,000

36万

Llama 4 Maverick

1,000,000

100,000

36万

Llama 3.3 70B Instruct

1,000,000

100,000

36万

Anthropic Claudeモデル

ITPM 制限

OTPM 制限

QPH 制限

Claude Fable 5.1

1,000,000

100,000

36万

Claude Fable 5

1,000,000

100,000

36万

Claude Haiku 5.5

200,000

2万

36万

クロード・ハイク 4.5

1,000,000

100,000

36万

Claude Opus 5

1,000,000

100,000

36万

Claude Opus 5.5

1,000,000

100,000

36万

Claude Opus 4.8

1,000,000

100,000

36万

Claude Opus 4.7

1,000,000

100,000

36万

クロード・オプス 4.6

1,000,000

100,000

36万

クロード・オプス 4.5

1,000,000

100,000

36万

クロード・オプス 4.1

1,000,000

100,000

36万

Claude Sonnet 5

1,000,000

100,000

36万

Claude Sonnet 5.5

1,000,000

100,000

36万

クロード・ソネット 4.6

1,000,000

100,000

36万

クロード・ソネット 4.5

1,000,000

100,000

36万

Anthropic Claudeモデル

ITPM 制限

OTPM 制限

QPH 制限

Claude Fable 5.1

1,000,000

100,000

36万

Claude Fable 5

1,000,000

100,000

36万

Claude Haiku 5.5

200,000

2万

36万

クロード・ハイク 4.5

1,000,000

100,000

36万

Claude Opus 5

1,000,000

100,000

36万

Claude Opus 5.5

1,000,000

100,000

36万

Claude Opus 4.8

1,000,000

100,000

36万

Claude Opus 4.7

1,000,000

100,000

36万

クロード・オプス 4.6

1,000,000

100,000

36万

クロード・オプス 4.5

1,000,000

100,000

36万

クロード・オプス 4.1

1,000,000

100,000

36万

Claude Sonnet 5

1,000,000

100,000

36万

Claude Sonnet 5.5

1,000,000

100,000

36万

クロード・ソネット 4.6

1,000,000

100,000

36万

クロード・ソネット 4.5

1,000,000

100,000

36万

埋め込みモデル

ITPM 制限

OTPM 制限

QPH 制限

Qwen3-埋め込み-0.6B

N/A

N/A

2,160,000

GTE Large (En)

N/A

N/A

540,000

BGE Large (En)

N/A

N/A

2,160,000

埋め込みモデル

ITPM 制限

OTPM 制限

QPH 制限

Qwen3-埋め込み-0.6B

N/A

N/A

2,160,000

GTE Large (En)

N/A

N/A

540,000

BGE Large (En)

N/A

N/A

2,160,000

TPMレート制限を管理するためのベストプラクティス​

ステップ 1.トークンの使用状況を監視する​

アプリケーションで入力トークン数と出力トークン数の両方を個別に追跡します。

Python
# Example: Track token usage
response = model.generate(prompt)
input_tokens = response.usage.prompt_tokens
output_tokens = response.usage.completion_tokens
total_tokens = response.usage.total_tokens

# Check against limits
if input_tokens > ITPM_LIMIT or output_tokens > OTPM_LIMIT:
# Implement backoff strategy
pass

ステップ2:リトライロジックを実装する ​

レート制限エラーが発生した場合に指数バックオフを追加します。

Python
import time
import random

def retry_with_exponential_backoff(
func,
initial_delay: float = 1,
exponential_base: float = 2,
jitter: bool = True,
max_retries: int = 10,
):
"""Retry a function with exponential backoff."""

num_retries = 0
delay = initial_delay

while num_retries < max_retries:
try:
return func()
except Exception as e:
if "rate_limit" in str(e) or "429" in str(e):
num_retries += 1

if jitter:
delay *= exponential_base * (1 + random.random())
else:
delay *= exponential_base

time.sleep(delay)
else:
raise e

raise Exception(f"Maximum retries {max_retries} exceeded")

ステップ 3.トークンの使用を最適化する​

  • プロンプトの長さを最小限に抑える : 簡潔で構造化されたプロンプトを使用する
  • 出力長の制御 : max_tokens パラメーターを使用して応答サイズを制限します
  • 効率的なバッチ処理 : 制限内に収まりながら、可能な場合は関連する要求をグループ化します

ステップ 4.モデル選択を検討する​

  • 高ボリュームタスク向けの小型モデル : より高い throughput を必要とするタスクには、GPT OSS 20B のようなモデルを使用します。
  • 複雑なタスク向けの大規模モデル :最大限の能力を必要とするタスクには GPT OSS 120B を確保してください。

モニタリングとトラブルシューティング​

トークンの使用パターンを監視して、パフォーマンスを最適化します。

Python
# Example: Log token usage for monitoring
import logging

logger = logging.getLogger(__name__)

def log_token_usage(response):
usage = response.usage
logger.info(f"Input tokens: {usage.prompt_tokens}")
logger.info(f"Output tokens: {usage.completion_tokens}")
logger.info(f"Total tokens: {usage.total_tokens}")

# Alert if approaching limits
if usage.prompt_tokens > ITPM_LIMIT * 0.8:
logger.warning("Approaching ITPM limit")
if usage.completion_tokens > OTPM_LIMIT * 0.8:
logger.warning("Approaching OTPM limit")

レート制限エラーの処理​

レート制限を超えると、API は 429 Too Many Requests エラーを返します。

JSON
{
"error": {
"message": "Rate limit exceeded: ITPM limit of 1,000,000 tokens reached",
"type": "rate_limit_exceeded",
"code": 429,
"limit_type": "input_tokens_per_minute",
"limit": 1000000,
"current": 1000150,
"retry_after": 15
}
}

エラー応答には次のものが含まれます。

  • limit_type: どの特定の制限を超えたか (ITPM、OTPM、QPS、または QPH)
  • limit:設定された制限値
  • current:現在の使用状況
  • retry_after: 推奨待ち時間 (秒単位)

サービス容量エラーの処理​

429 Too Many Requests エラーは、ワークロードがお客様の管理下にあるレート制限を超過したことを意味します。503 Service Unavailable エラーは異なります。基盤モデル APIs が一時的に容量に達し、リクエストを処理できなかったことを意味します。503 エラーは、独自のレート制限に達したことを示すものではなく、それに数えられません。

ステップ 2. リトライロジックの実装と同じパターンに従って、503 レスポンスを一時的なものとして扱い、エクスポネンシャル バックオフで再試行します。一貫した容量を必要とする本番運用ワークロードの場合は、共有のトークン単位の従量課金容量ではなく専用の容量を提供するプロビジョニング済みthroughputを使用します。サポートされている基盤モデルについては、予約済みプロビジョニング済み throughputおよびオンデマンド プロビジョニング済み throughputに関するドキュメントを参照してください。

一般的な問題とソリューション​

問題

ソリューション

頻繁な 429 エラー

指数バックオフの実装、要求レートの削減、より高いレート制限の要求

ITPM 制限に達しました

プロンプトの長さを最適化する

OTPM 制限に達しました

max_tokensを使用して応答長を制限する

QPH 制限に達しました

時間の経過とともに要求をより均等に分散する

503 サービス Unavailable

指数関数的バックオフで再試行します。一貫した本番運用キャパシティが必要な場合は、プロビジョニング済みthroughputを使用します

問題

ソリューション

頻繁な 429 エラー

指数バックオフの実装、要求レートの削減、より高いレート制限の要求

ITPM 制限に達しました

プロンプトの長さを最適化する

OTPM 制限に達しました

max_tokensを使用して応答長を制限する

QPH 制限に達しました

時間の経過とともに要求をより均等に分散する

503 サービス Unavailable

指数関数的バックオフで再試行します。一貫した本番運用キャパシティが必要な場合は、プロビジョニング済みthroughputを使用します

プロビジョニングされたスループットの制限​

より高い制限を必要とする本番運用ワークロードの場合、プロビジョニング スループット エンドポイントは以下を提供します。

  • TPM 制限なし : プロビジョニングされたリソースに基づく処理容量
  • より高いレート制限 : ワークスペースごとに最大 200 クエリ/秒
  • 予測可能なパフォーマンス : 専用リソースにより、一貫した待機時間が確保されます

出力トークンの制限​

以下の表は、サポートされている各モデルの出力トークン制限をまとめたものです。

モデル

出力トークンの制限

GPT OSS 120B

25,000

GPT OSS 20B

25,000

Gemma 3 12B

8,192

Llama 4 Maverick

8,192

Llama 3.1 70B

8,192

Llama 3.1 8B

8,192

モデル

出力トークンの制限

GPT OSS 120B

25,000

GPT OSS 20B

25,000

Gemma 3 12B

8,192

Llama 4 Maverick

8,192

Llama 3.1 70B

8,192

Llama 3.1 8B

8,192

追加の制限​

プロビジョニングされたスループットワークロードの制限は次のとおりです。

  • GTE Large (En) 埋め込みモデルでは、正規化された埋め込みは生成されません。
  • Llama 4 Maverick を使用するプロビジョニングされたスループットワークロードの場合:
    • プロビジョニングされたスループット ワークロードでのこのモデルのサポートは、 パブリック プレビュー段階です。
    • オートスケールはサポートされていません。
    • メトリクスパネルはサポートされていません。
    • トラフィック分割は、Llama 4 Maverick にサービスを提供するエンドポイントではサポートされていません。Llama 4 Maverick を提供するエンドポイントで複数のモデルを提供することはできません。

地域別の可用性とデータ処理​

Databricksがホストする 基盤モデルのリージョン可用性については、「基盤モデルの概要」を参照してください。

データ処理と常駐の詳細については、「 データ処理と常駐」を参照してください。

基盤モデルおよび外部モデルのリソースとペイロード制限​

次の表は、基盤モデルと外部モデルを提供するエンドポイントのリソースとペイロードの制限をまとめたものです。

機能

粒度

上限

ペイロードサイズ

リクエストに応じて

4MB

1秒間に処理できるクエリー数(QPS)

ワークスペースごと

200

モデル実行期間

リクエストに応じて

597秒

オーバーヘッドレイテンシ

リクエストに応じて

50ミリ秒未満

機能

粒度

上限

ペイロードサイズ

リクエストに応じて

4MB

1秒間に処理できるクエリー数(QPS)

ワークスペースごと

200

モデル実行期間

リクエストに応じて

597秒

オーバーヘッドレイテンシ

リクエストに応じて

50ミリ秒未満

Additional リソース​