Pular para o conteúdo principal

Pagamento por tokens Prioritário para APIs de Modelo de Fundação

Esta página descreve o pagamento por token prioritário para APIs de Modelo de Fundação pay-per-token, incluindo como ele se comporta e como enviar solicitações prioritárias.

O que é pagamento por token prioritário?

Pagamento por token prioritário, também conhecido como modo de prioridade, é um recurso de pagamento por token para aplicações de tempo real e sensíveis à latência. Quando você envia uma solicitação com o parâmetro service_tier definido como "priority", o Databricks admite a solicitação à frente do tráfego padrão de melhor esforço de pagamento por token no mesmo modelo. Isso mantém a disponibilidade mais consistente durante períodos de alto tráfego.

O pagamento por token prioritário é opcional por solicitação, de modo que é possível enviar solicitações prioritárias e padrão para o mesmo modelo. Não exige compromisso de capacidade e é cobrado a uma taxa por token mais alta do que as solicitações padrão de pagamento por token.

A Databricks recomenda o modo de prioridade quando:

  • Você precisa de desempenho e disponibilidade mais consistentes do que o pagamento por token padrão, mas não está pronto para commit com capacidade dedicada.
  • Suas aplicações em produção exigem maior disponibilidade.

Modelos compatíveis

Os seguintes modelos de pagamento por token suportam o modo de prioridade. Para enviar uma solicitação prioritária, use o nome do endpoint do modelo com o parâmetro service_tier definido como "priority".

Provedor

Modelo

Nome do endpoint

Notas

OpenAI

GPT-5.6 Sol

databricks-gpt-5-6-sol

OpenAI

GPT-5.6 Terra

databricks-gpt-5-6-terra

OpenAI

GPT-5.6 Luna

databricks-gpt-5-6-luna

OpenAI

GPT-5.5

databricks-gpt-5-5

OpenAI

GPT-5.4

databricks-gpt-5-4

OpenAI

GPT-5.4 mini

databricks-gpt-5-4-mini

OpenAI

GPT-5.3 Codex

databricks-gpt-5-3-codex

OpenAI

GPT-5.2

databricks-gpt-5-2

OpenAI

GPT-5.1

databricks-gpt-5-1

OpenAI

GPT-5

databricks-gpt-5

OpenAI

GPT-5 mini

databricks-gpt-5-mini

google

Gemini 3.5 Flash

databricks-gemini-3-5-flash

Disponível apenas no endpoint global. Requer roteamento entre geografias.

google

Gemini 3.1 Pro

databricks-gemini-3-1-pro

Disponível apenas no endpoint global. Requer roteamento entre geografias.

google

Gemini 3.1 Flash Lite

databricks-gemini-3-1-flash-lite

Disponível apenas no endpoint global. Requer roteamento entre geografias.

google

Gemini 3 Flash

databricks-gemini-3-flash

Disponível apenas no endpoint global. Requer roteamento entre geografias.

Provedor

Modelo

Nome do endpoint

Notas

OpenAI

GPT-5.6 Sol

databricks-gpt-5-6-sol

OpenAI

GPT-5.6 Terra

databricks-gpt-5-6-terra

OpenAI

GPT-5.6 Luna

databricks-gpt-5-6-luna

OpenAI

GPT-5.5

databricks-gpt-5-5

OpenAI

GPT-5.4

databricks-gpt-5-4

OpenAI

GPT-5.4 mini

databricks-gpt-5-4-mini

OpenAI

GPT-5.3 Codex

databricks-gpt-5-3-codex

OpenAI

GPT-5.2

databricks-gpt-5-2

OpenAI

GPT-5.1

databricks-gpt-5-1

OpenAI

GPT-5

databricks-gpt-5

OpenAI

GPT-5 mini

databricks-gpt-5-mini

google

Gemini 3.5 Flash

databricks-gemini-3-5-flash

Disponível apenas no endpoint global. Requer roteamento entre geografias.

google

Gemini 3.1 Pro

databricks-gemini-3-1-pro

Disponível apenas no endpoint global. Requer roteamento entre geografias.

google

Gemini 3.1 Flash Lite

databricks-gemini-3-1-flash-lite

Disponível apenas no endpoint global. Requer roteamento entre geografias.

google

Gemini 3 Flash

databricks-gemini-3-flash

Disponível apenas no endpoint global. Requer roteamento entre geografias.

Como o pagamento por token prioritário se comporta

Considere o seguinte comportamento antes de usar o pagamento por token prioritário:

  • Desempenho e disponibilidade consistentes O pagamento por token prioritário foi projetado para manter a disponibilidade consistente sob carga. Não garante um tempo específico até o primeiro token ou meta de latência de ponta a ponta. Solicitações prioritárias visam uma disponibilidade maior do que as solicitações padrão de pagamento por token. A Databricks define a disponibilidade em uma camada como o número de solicitações bem-sucedidas dividido pelo número total de solicitações admitidas naquela camada.
  • Capacidade de melhor esforço . O modo de prioridade não reserva capacidade e não há compromisso de capacidade. Para capacidade garantida, use o throughput provisionado.
  • **Fallback** para pagamento por token padrão. Se a capacidade prioritária estiver totalmente subscrita, as solicitações são atendidas com a disponibilidade padrão de pagamento por token e faturadas às taxas padrão de pagamento por token.
  • **Premium por token**. As solicitações prioritárias são cobradas a uma taxa por token mais alta do que as solicitações padrão de pagamento por token.

Pagamento por tokens prioritário em comparação com o throughput provisionado

O pagamento prioritário por tokens e o throughput provisionado visam cargas de trabalho de produção, mas fazem diferentes compensações:

Consideração

Pagamento por token prioritário

Throughput provisionado

Capacidade

Melhor esforço, compartilhado.

Capacidade dedicada e reservada.

Compromisso

Nenhuma. Aceite por solicitação.

Exige um Endpoint provisionado.

Disponibilidade

Mais consistente do que o pagamento por token padrão sob carga.

Previsível, com base na capacidade reservada.

Cobrança

Por token, com um custo adicional em relação ao pagamento por token padrão.

Com base nas unidades de modelo provisionadas.

Consideração

Pagamento por token prioritário

Throughput provisionado

Capacidade

Melhor esforço, compartilhado.

Capacidade dedicada e reservada.

Compromisso

Nenhuma. Aceite por solicitação.

Exige um Endpoint provisionado.

Disponibilidade

Mais consistente do que o pagamento por token padrão sob carga.

Previsível, com base na capacidade reservada.

Cobrança

Por token, com um custo adicional em relação ao pagamento por token padrão.

Com base nas unidades de modelo provisionadas.

Envie uma solicitação prioritária

Para usar o modo de prioridade, defina o parâmetro service_tier como "priority" por solicitação. O exemplo a seguir usa o cliente OpenAI:

Python
from databricks_openai import DatabricksOpenAI

client = DatabricksOpenAI()

response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)

Consulte Referência da API REST do Foundation Model para obter a sintaxe dos parâmetros e Usar modelos de fundação para obter mais opções de query.

Limites de capacidade

Cada cluster oferece suporte a um número total máximo de tokens por minuto em todos os tenants. A Databricks define um limite por tenant durante o onboarding para que um único tenant não possa consumir toda a capacidade do cluster. Se sua carga de trabalho exigir mais capacidade do que o limite por tenant permite, solicite throughput provisionada.

Para mais limites das APIs do Foundation Model, consulte limites e cotas das APIs do Foundation Model.

Recursos adicionais