Pular para o conteúdo principal

Limites e cotas das APIs do Foundation Model

Esta página descreve os limites e as cotas das cargas de trabalho das APIs do Databricks Foundation Model.

Databricks Foundation Model APIs impõe limites de taxa para garantir desempenho confiável e alocação justa de recursos para todos os usuários. Esses limites variam de acordo com o nível da plataformaworkspace, o tipo de modelo de fundação e como o senhor implantou o modelo de fundação.

Pay-per-tokens endpoint limites de taxa​

Os pontos de extremidade de pagamento por tokens são regidos por limites de taxa baseados em tokens e em consultas. Os limites de taxa baseados em tokens controlam o número máximo de tokens que pode ser processado por minuto e são aplicados separadamente para entrada e saída tokens.

  • Entrada tokens por minuto (ITPM) : O número máximo de entradas tokens (de seus prompts) que podem ser processadas em uma janela de 60 segundos. Um limite de taxa de ITPM controla os tokens de entrada Taxa de transferência de um endpoint.
  • tokens de saída por minuto (OTPM) : O número máximo de tokens de saída (das respostas do modelo) que podem ser gerados em um intervalo de 60 segundos. Um limite de taxa OTPM controla a taxa de transferência de tokens de saída de um endpoint.
  • Consultas por hora : o número máximo de consultas ou solicitações que podem ser processadas em uma janela de 60 minutos. Para aplicativos de produção com padrões de uso sustentados, o site Databricks recomenda o provisionamento de taxa de transferência de endpoint, que fornece capacidade garantida.

Como os limites são monitorados e aplicados​

O limite de taxa mais restritivo (ITPM, OTPM, QPH) aplica-se em qualquer momento. Por exemplo, mesmo que você não tenha atingido seu limite de ITPM, você ainda pode ter sua taxa de transferência limitada se exceder o limite de QPH ou OTPM. Quando o limite do ITPM ou do OTPM é atingido, as solicitações subsequentes recebem um erro 429, que indica que foram recebidas solicitações em excesso. Esta mensagem persiste até que o período de limite de taxa seja redefinido.

Databricks rastreia e impõe limites de taxa de tokens por minuto (TPM) usando o seguinte recurso:

Recurso

Detalhes

Contabilidade de tokens e verificações de pré-admissão

  • Contagem de tokens de entrada : A entrada tokens é contada a partir de seu prompt real no momento da solicitação.
  • Estimativa de tokens de saída : Se o senhor fornecer max_tokens em sua solicitação, Databricks usará esse valor para estimar e reservar a capacidade de tokens de saída antes que a solicitação seja admitida para processamento.
  • Validação pré-admissão : A Databricks verifica se sua solicitação excederia os limites de ITPM ou OTPM antes de iniciar o processamento. Se o site max_tokens fizer com que o senhor exceda os limites do OTPM, o Databricks rejeitará a solicitação imediatamente com um erro 429.
  • Saída real versus saída estimada : Depois que a resposta é gerada, os tokens de saída reais são contados. É importante ressaltar que, se o uso real de tokens for menor do que o reservado max_tokens, Databricks credita a diferença de volta ao seu limite de taxa , tornando esses tokens imediatamente disponíveis para outras solicitações.
  • Não foi especificado max_tokens : Se o senhor não especificar max_tokens, Databricks usará uma reserva default e a contagem real de tokens será reconciliada após a geração.

Capacidade de explosão e suavização

  • Buffer de burst : O limitador de taxa inclui um pequeno buffer para acomodar rajadas curtas de tráfego acima da taxa nominal.
  • Janela desl izante: O consumo de tokens é rastreado usando um algoritmo de janela deslizante que fornece uma limitação de taxa mais suave do que os limites rígidos por minuto.
  • Algoritmo de tokens bucket : o site Databricks usa uma implementação de tokens bucket que permite alguma capacidade de explosão e, ao mesmo tempo, mantém o limite de taxa média ao longo do tempo.

Recurso

Detalhes

Contabilidade de tokens e verificações de pré-admissão

  • Contagem de tokens de entrada : A entrada tokens é contada a partir de seu prompt real no momento da solicitação.
  • Estimativa de tokens de saída : Se o senhor fornecer max_tokens em sua solicitação, Databricks usará esse valor para estimar e reservar a capacidade de tokens de saída antes que a solicitação seja admitida para processamento.
  • Validação pré-admissão : A Databricks verifica se sua solicitação excederia os limites de ITPM ou OTPM antes de iniciar o processamento. Se o site max_tokens fizer com que o senhor exceda os limites do OTPM, o Databricks rejeitará a solicitação imediatamente com um erro 429.
  • Saída real versus saída estimada : Depois que a resposta é gerada, os tokens de saída reais são contados. É importante ressaltar que, se o uso real de tokens for menor do que o reservado max_tokens, Databricks credita a diferença de volta ao seu limite de taxa , tornando esses tokens imediatamente disponíveis para outras solicitações.
  • Não foi especificado max_tokens : Se o senhor não especificar max_tokens, Databricks usará uma reserva default e a contagem real de tokens será reconciliada após a geração.

Capacidade de explosão e suavização

  • Buffer de burst : O limitador de taxa inclui um pequeno buffer para acomodar rajadas curtas de tráfego acima da taxa nominal.
  • Janela desl izante: O consumo de tokens é rastreado usando um algoritmo de janela deslizante que fornece uma limitação de taxa mais suave do que os limites rígidos por minuto.
  • Algoritmo de tokens bucket : o site Databricks usa uma implementação de tokens bucket que permite alguma capacidade de explosão e, ao mesmo tempo, mantém o limite de taxa média ao longo do tempo.

A seguir está um exemplo de como a verificação pré-admissão e o comportamento de devolução do crédito funcionam.

Python
# Request with max_tokens specified
request = {
"prompt": "Write a story about...", # 10 input tokens
"max_tokens": 500 # System reserves 500 output tokens
}

# Pre-admission check:
# - Verifies 10 tokens against ITPM limit
# - Reserves 500 tokens against OTPM limit
# - If either would exceed limits, returns 429 immediately

# If admitted, actual response uses only 350 tokens
# The system credits back 150 tokens (500 - 350) to your OTPM allowance
# These 150 tokens are immediately available for other requests

Limites de taxa por modelo​

As tabelas a seguir resumem os limites de taxa de ITPM, OTPM e QPH para os Endpoint da API do Foundation Model de pagamento por tokens para Workspace na camada de plataforma de Workspace Enterprise :

nota

Para modelos que oferecem suporte a throughput provisionado, crie um endpoint de throughput provisionado se os limites de pagamento por token não atenderem aos requisitos do seu caso de uso.

Níveis de cota de tokens de modelos de parceiros​

A escala de cota de tokens de modelos de parceiros tem três níveis numerados. Os modelos de parceiros usam o Tier 1 por default, a menos que uma restrição de capacidade do provedor específica do modelo exija um limite menor. Esses níveis de cota são separados do seu workspace platform tier.

Nível de cota

Limite de ITPM

Limite OTPM

Disponibilidade

Camada 1

1.000.000

100.000

Aplicado automaticamente a modelos de parceiros, a menos que se aplique uma exceção de capacidade do provedor específica do modelo

Camada 2

5.000.000

500.000

Disponível por meio do fluxo de solicitação de cota

Camada 3

10.000.000

1.000.000

Disponível por meio do fluxo de solicitação de cota

Nível de cota

Limite de ITPM

Limite OTPM

Disponibilidade

Camada 1

1.000.000

100.000

Aplicado automaticamente a modelos de parceiros, a menos que se aplique uma exceção de capacidade do provedor específica do modelo

Camada 2

5.000.000

500.000

Disponível por meio do fluxo de solicitação de cota

Camada 3

10.000.000

1.000.000

Disponível por meio do fluxo de solicitação de cota

Custom token limits require a capacity review by Databricks and are outside these three tiers. Token quota tiers change only ITPM and OTPM limits; RPS, QPS, RPH, and QPH limits remain model-specific. A partner model retains a lower default only for a model-specific provider-capacity constraint. Open models retain the default shown in the following tables.

Grandes modelos de linguagem

Limite de ITPM

Limite OTPM

Limite de QPH

GPT-6.1 Sol

1.000.000

100.000

360.000

GPT-6 Sol

1.000.000

100.000

360.000

GPT-6 Luna

1.000.000

100.000

360.000

GPT-6 Astra

1.000.000

100.000

360.000

GPT-5.6 Sol

1.000.000

100.000

360.000

GPT-5.6 Terra

1.000.000

100.000

360.000

GPT-5.6 Luna

1.000.000

100.000

360.000

GPT-5.5 Pro

1.000.000

100.000

360.000

GPT-5.5

1.000.000

100.000

360.000

GPT-5.4

1.000.000

100.000

360.000

GPT-5.4 mini

1.000.000

100.000

360.000

GPT-5.4 nano

1.000.000

100.000

360.000

Códice GPT-5.3

1.000.000

100.000

360.000

GPT-5.2

1.000.000

100.000

360.000

GPT-5.1

1.000.000

100.000

360.000

GPT-5

1.000.000

100.000

360.000

GPT-5 mini

1.000.000

100.000

360.000

GPT-5 nano

1.000.000

100.000

360.000

Gemini 3.1 Flash Image

1.000.000

100.000

360.000

Imagem do Gemini 3 Pro

1.000.000

100.000

360.000

Gemini 3.5 Flash Lite

1.000.000

100.000

360.000

Gemini 3.8 Flash

1.000.000

100.000

360.000

Gemini 3.7 Flash

1.000.000

100.000

360.000

Gemini 3.6 Flash

1.000.000

100.000

360.000

Gemini 3.5 Flash

1.000.000

100.000

360.000

Prévia do Gemini 3.1 Pro

1.000.000

100.000

360.000

Gemini 3.1 Flash Lite

1.000.000

100.000

360.000

Gemini 3 Flash

1.000.000

100.000

360.000

Qwen3.5 122B A10B (Prévia Pública)

1.000.000

100.000

360.000

Qwen3-Next 80B A3B Instrução (Beta)

1.000.000

100.000

360.000

GLM 5.3

2.000.000

40.000

7.200

GLM 5.3 Flash

2.000.000

40.000

7.200

GLM 5.2 (legado)

200.000

20.000

7.200

OpenJev (Qwen3.5 4B)

2.000.000

40.000

7.200

DeepSeek V4.1 Flash

2.000.000

40.000

7.200

DeepSeek V4 Pro (0813)

200.000

4.000

7.200

DeepSeek V4 Flash (0731)

200.000

10.000

Kimi K3

2.000.000

40.000

Grok 4,6

1.000.000

100.000

360.000

Grok 4.7

1.000.000

100.000

360.000

Inkling (Pré-lançamento público)

200.000

10.000

7.200

PERDA DE GPT 120G

1.000.000

100.000

360.000

PERDA DE GPT 20B

1.000.000

100.000

360.000

Gemma 3 12B

1.000.000

100.000

360.000

Llama 4 Maverick

1.000.000

100.000

360.000

Llama 3.3 70B Instruct

1.000.000

100.000

360.000

Llama 3.1 8B Instruct

1.000.000

100.000

360.000

Grandes modelos de linguagem

Limite de ITPM

Limite OTPM

Limite de QPH

GPT-6.1 Sol

1.000.000

100.000

360.000

GPT-6 Sol

1.000.000

100.000

360.000

GPT-6 Luna

1.000.000

100.000

360.000

GPT-6 Astra

1.000.000

100.000

360.000

GPT-5.6 Sol

1.000.000

100.000

360.000

GPT-5.6 Terra

1.000.000

100.000

360.000

GPT-5.6 Luna

1.000.000

100.000

360.000

GPT-5.5 Pro

1.000.000

100.000

360.000

GPT-5.5

1.000.000

100.000

360.000

GPT-5.4

1.000.000

100.000

360.000

GPT-5.4 mini

1.000.000

100.000

360.000

GPT-5.4 nano

1.000.000

100.000

360.000

Códice GPT-5.3

1.000.000

100.000

360.000

GPT-5.2

1.000.000

100.000

360.000

GPT-5.1

1.000.000

100.000

360.000

GPT-5

1.000.000

100.000

360.000

GPT-5 mini

1.000.000

100.000

360.000

GPT-5 nano

1.000.000

100.000

360.000

Gemini 3.1 Flash Image

1.000.000

100.000

360.000

Imagem do Gemini 3 Pro

1.000.000

100.000

360.000

Gemini 3.5 Flash Lite

1.000.000

100.000

360.000

Gemini 3.8 Flash

1.000.000

100.000

360.000

Gemini 3.7 Flash

1.000.000

100.000

360.000

Gemini 3.6 Flash

1.000.000

100.000

360.000

Gemini 3.5 Flash

1.000.000

100.000

360.000

Prévia do Gemini 3.1 Pro

1.000.000

100.000

360.000

Gemini 3.1 Flash Lite

1.000.000

100.000

360.000

Gemini 3 Flash

1.000.000

100.000

360.000

Qwen3.5 122B A10B (Prévia Pública)

1.000.000

100.000

360.000

Qwen3-Next 80B A3B Instrução (Beta)

1.000.000

100.000

360.000

GLM 5.3

2.000.000

40.000

7.200

GLM 5.3 Flash

2.000.000

40.000

7.200

GLM 5.2 (legado)

200.000

20.000

7.200

OpenJev (Qwen3.5 4B)

2.000.000

40.000

7.200

DeepSeek V4.1 Flash

2.000.000

40.000

7.200

DeepSeek V4 Pro (0813)

200.000

4.000

7.200

DeepSeek V4 Flash (0731)

200.000

10.000

Kimi K3

2.000.000

40.000

Grok 4,6

1.000.000

100.000

360.000

Grok 4.7

1.000.000

100.000

360.000

Inkling (Pré-lançamento público)

200.000

10.000

7.200

PERDA DE GPT 120G

1.000.000

100.000

360.000

PERDA DE GPT 20B

1.000.000

100.000

360.000

Gemma 3 12B

1.000.000

100.000

360.000

Llama 4 Maverick

1.000.000

100.000

360.000

Llama 3.3 70B Instruct

1.000.000

100.000

360.000

Llama 3.1 8B Instruct

1.000.000

100.000

360.000

Anthropic Modelos Claude

Limite de ITPM

Limite OTPM

Limite de QPH

Claude Fable 5.1

1.000.000

100.000

360.000

Claude Fable 5

1.000.000

100.000

360.000

Claude Haiku 5.5

200.000

20.000

360.000

Claude Haiku 4.5

1.000.000

100.000

360.000

Claude Opus 5

1.000.000

100.000

360.000

Claude Opus 5.5

1.000.000

100.000

360.000

Claude Opus 4.8

1.000.000

100.000

360.000

Claude Opus 4.7

1.000.000

100.000

360.000

Claude Opus 4.6

1.000.000

100.000

360.000

Claude Opus 4.5

1.000.000

100.000

360.000

Claude Opus 4.1

1.000.000

100.000

360.000

Claude Sonnet 5

1.000.000

100.000

360.000

Claude Sonnet 5.5

1.000.000

100.000

360.000

Soneto 4.6 de Claude

1.000.000

100.000

360.000

Soneto de Claude 4.5

1.000.000

100.000

360.000

Anthropic Modelos Claude

Limite de ITPM

Limite OTPM

Limite de QPH

Claude Fable 5.1

1.000.000

100.000

360.000

Claude Fable 5

1.000.000

100.000

360.000

Claude Haiku 5.5

200.000

20.000

360.000

Claude Haiku 4.5

1.000.000

100.000

360.000

Claude Opus 5

1.000.000

100.000

360.000

Claude Opus 5.5

1.000.000

100.000

360.000

Claude Opus 4.8

1.000.000

100.000

360.000

Claude Opus 4.7

1.000.000

100.000

360.000

Claude Opus 4.6

1.000.000

100.000

360.000

Claude Opus 4.5

1.000.000

100.000

360.000

Claude Opus 4.1

1.000.000

100.000

360.000

Claude Sonnet 5

1.000.000

100.000

360.000

Claude Sonnet 5.5

1.000.000

100.000

360.000

Soneto 4.6 de Claude

1.000.000

100.000

360.000

Soneto de Claude 4.5

1.000.000

100.000

360.000

Modelos de incorporação

Limite de ITPM

Limite OTPM

Limite de QPH

Qwen3-Embedding-0.6B

N/A

N/A

2.160.000

GTE Large (En)

N/A

N/A

540.000

BGE Grande (En)

N/A

N/A

2.160.000

Modelos de incorporação

Limite de ITPM

Limite OTPM

Limite de QPH

Qwen3-Embedding-0.6B

N/A

N/A

2.160.000

GTE Large (En)

N/A

N/A

540.000

BGE Grande (En)

N/A

N/A

2.160.000

Melhores práticas para gerenciar limites de taxa de TPM​

Etapa 1. Monitorar o uso de tokens​

Acompanhe as contagens de tokens de entrada e saída separadamente em seus aplicativos:

Python
# Example: Track token usage
response = model.generate(prompt)
input_tokens = response.usage.prompt_tokens
output_tokens = response.usage.completion_tokens
total_tokens = response.usage.total_tokens

# Check against limits
if input_tokens > ITPM_LIMIT or output_tokens > OTPM_LIMIT:
# Implement backoff strategy
pass

O passo 2. Implemente a lógica de repetição ​

Adicione um recuo exponencial ao encontrar erros de limite de taxa:

Python
import time
import random

def retry_with_exponential_backoff(
func,
initial_delay: float = 1,
exponential_base: float = 2,
jitter: bool = True,
max_retries: int = 10,
):
"""Retry a function with exponential backoff."""

num_retries = 0
delay = initial_delay

while num_retries < max_retries:
try:
return func()
except Exception as e:
if "rate_limit" in str(e) or "429" in str(e):
num_retries += 1

if jitter:
delay *= exponential_base * (1 + random.random())
else:
delay *= exponential_base

time.sleep(delay)
else:
raise e

raise Exception(f"Maximum retries {max_retries} exceeded")

Etapa 3. Otimizar o uso de tokens​

  • Minimize a duração do prompt : use prompts concisos e bem estruturados
  • Controle o comprimento da saída : use o parâmetro max_tokens para limitar o tamanho da resposta
  • de forma eficiente : Agrupar solicitações relacionadas quando possível, mantendo-se dentro dos limites

Etapa 4. Considere a seleção do modelo​

  • Modelos menores para tarefas de alto volume : utilize modelos como o GPT OSS 20B para tarefas que exigem maior throughput.
  • Modelos grandes para tarefas complexas : reserve o GPT OSS 120B para tarefas que exigem capacidade máxima.

monitoramento e solução de problemas​

Monitore seus padrões de uso de tokens para otimizar o desempenho:

Python
# Example: Log token usage for monitoring
import logging

logger = logging.getLogger(__name__)

def log_token_usage(response):
usage = response.usage
logger.info(f"Input tokens: {usage.prompt_tokens}")
logger.info(f"Output tokens: {usage.completion_tokens}")
logger.info(f"Total tokens: {usage.total_tokens}")

# Alert if approaching limits
if usage.prompt_tokens > ITPM_LIMIT * 0.8:
logger.warning("Approaching ITPM limit")
if usage.completion_tokens > OTPM_LIMIT * 0.8:
logger.warning("Approaching OTPM limit")

Lidar com erros de limite de taxa​

Quando o senhor excede os limites de taxa, a API retorna um erro 429 Too Many Requests:

JSON
{
"error": {
"message": "Rate limit exceeded: ITPM limit of 1,000,000 tokens reached",
"type": "rate_limit_exceeded",
"code": 429,
"limit_type": "input_tokens_per_minute",
"limit": 1000000,
"current": 1000150,
"retry_after": 15
}
}

A resposta de erro inclui:

  • limit_type: Qual limite específico foi excedido (ITPM, OTPM, QPS ou QPH)
  • limit: O valor limite configurado
  • current: Seu uso atual
  • retry_after: Tempo de espera sugerido em segundos

Lidar com erros de capacidade de serviço​

Um erro 429 Too Many Requests significa que sua carga de trabalho excedeu um limite de taxa sob seu controle. Um erro 503 Service Unavailable é diferente: significa que as APIs do Foundation Model estão temporariamente sem capacidade e não puderam atender à sua solicitação. Um erro 503 não conta contra nem indica que você atingiu seus próprios limites de taxa.

Trate as respostas 503 como transitórias e tente novamente com backoff exponencial, seguindo o mesmo padrão de o passo 2. Implementar lógica de repetição. Para cargas de trabalho de produção que precisam de capacidade consistente, use o provisionamento de throughput, que fornece capacidade dedicada em vez de capacidade compartilhada de pagamento por token. Consulte a documentação sobre throughput provisionado reservado e throughput provisionado sob demanda para ver os modelos de fundação suportados.

Problemas e soluções comuns​

Problema

soluções

Erros frequentes (429)

Implemente o recuo exponencial, reduza a taxa de solicitações e solicite limites de taxa mais altos

Limite de ITPM atingido

Otimize o comprimento do prompt

Limite de OTPM atingido

Use max_tokens para limitar a duração da resposta

Limite de QPH atingido

Distribua as solicitações de forma mais uniforme ao longo do tempo

503 Serviço Indisponível

Tente novamente com backoff exponencial; para obter capacidade de produção consistente, use throughput provisionado

Problema

soluções

Erros frequentes (429)

Implemente o recuo exponencial, reduza a taxa de solicitações e solicite limites de taxa mais altos

Limite de ITPM atingido

Otimize o comprimento do prompt

Limite de OTPM atingido

Use max_tokens para limitar a duração da resposta

Limite de QPH atingido

Distribua as solicitações de forma mais uniforme ao longo do tempo

503 Serviço Indisponível

Tente novamente com backoff exponencial; para obter capacidade de produção consistente, use throughput provisionado

provisionamento Taxa de transferência limits​

Para cargas de trabalho de produção que exigem limites mais altos, o provisionamento Taxa de transferência endpoint offer:

  • Sem restrições de TPM : Capacidade de processamento com base no provisionamento recurso
  • Limites de taxa mais altos : Até 200 consultas por segundo por workspace
  • Desempenho previsível : recursos dedicados garantem latência consistente

Limites de tokens de saída​

A tabela a seguir resume os limites de tokens de saída para cada modelo compatível:

Modelo

Limite de tokens de saída

PERDA DE GPT 120G

25.000

PERDA DE GPT 20B

25.000

Gemma 3 12B

8.192

Llama 4 Maverick

8.192

Llama 3.1 70B

8.192

Llama 3.1 8B

8.192

Modelo

Limite de tokens de saída

PERDA DE GPT 120G

25.000

PERDA DE GPT 20B

25.000

Gemma 3 12B

8.192

Llama 4 Maverick

8.192

Llama 3.1 70B

8.192

Llama 3.1 8B

8.192

Limites adicionais​

A seguir estão as limitações para cargas de trabalho de provisionamento de taxa de transferência:

  • Para cargas de trabalho de provisionamento Taxa de transferência que usam Llama 4 Maverick :

    • O suporte a esse modelo em cargas de trabalho de Taxa de transferência de provisionamento está em Public Preview.
    • a autoescala não é suportada.
    • Não há suporte para painéis de métricas.
    • A divisão de tráfego não é suportada em um endpoint que atende ao Llama 4 Maverick. O senhor não pode atender a vários modelos em um endpoint que atende ao Llama 4 Maverick.
  • Para implantar um modelo Meta Llama de system.ai em Unity Catalog, o senhor deve escolher a versão do Instruct aplicável. As versões básicas dos modelos Meta Llama não são compatíveis com a implantação a partir do Unity Catalog. Veja o ponto final da Taxa de transferência de provisionamento implantado.

Disponibilidade regional e processamento de dados​

Para obter a disponibilidade da região do modelo de fundação hospedado pelo Databricks, consulte Visão geral do modelo de fundação.

Para obter detalhes sobre processamento de dados e residência, consulte Processamento de dados e residência.

Limites de recursos e de carga útil para modelos da Fundação e modelos externos.​

As tabelas a seguir resumem os limites de recursos e de carga útil para modelos de serviço de endpoints e modelos externos.

Recurso

Granularidade

Limite

Tamanho da carga útil

A pedido

4 MB

Tamanho da solicitação/resposta

A pedido

Qualquer solicitação/resposta com mais de 1 MB não será registrada.

Consultas por segundo (QPS)

Por workspace

200

Modelo de execução de leilões

A pedido

597 segundos

Latência de sobrecarga

A pedido

Menos de 50 milissegundos

Recurso

Granularidade

Limite

Tamanho da carga útil

A pedido

4 MB

Tamanho da solicitação/resposta

A pedido

Qualquer solicitação/resposta com mais de 1 MB não será registrada.

Consultas por segundo (QPS)

Por workspace

200

Modelo de execução de leilões

A pedido

597 segundos

Latência de sobrecarga

A pedido

Menos de 50 milissegundos

Recurso adicional​