Pagamento por tokens Prioritário para APIs de Modelo de Fundação
Esta página descreve o pagamento por token prioritário para APIs de Modelo de Fundação pay-per-token, incluindo como ele se comporta e como enviar solicitações prioritárias.
O que é pagamento por token prioritário?
Pagamento por token prioritário, também conhecido como modo de prioridade, é um recurso de pagamento por token para aplicações de tempo real e sensíveis à latência. Quando você envia uma solicitação com o parâmetro service_tier definido como "priority", o Databricks admite a solicitação à frente do tráfego padrão de melhor esforço de pagamento por token no mesmo modelo. Isso mantém a disponibilidade mais consistente durante períodos de alto tráfego.
O pagamento por token prioritário é opcional por solicitação, de modo que é possível enviar solicitações prioritárias e padrão para o mesmo modelo. Não exige compromisso de capacidade e é cobrado a uma taxa por token mais alta do que as solicitações padrão de pagamento por token.
A Databricks recomenda o modo de prioridade quando:
- Você precisa de desempenho e disponibilidade mais consistentes do que o pagamento por token padrão, mas não está pronto para commit com capacidade dedicada.
- Suas aplicações em produção exigem maior disponibilidade.
Modelos compatíveis
Os seguintes modelos de pagamento por token suportam o modo de prioridade. Para enviar uma solicitação prioritária, use o nome do endpoint do modelo com o parâmetro service_tier definido como "priority".
Provedor | Modelo | Nome do endpoint | Notas |
|---|---|---|---|
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
| Disponível apenas no endpoint global. Requer roteamento entre geografias. | ||
| Disponível apenas no endpoint global. Requer roteamento entre geografias. | ||
| Disponível apenas no endpoint global. Requer roteamento entre geografias. | ||
| Disponível apenas no endpoint global. Requer roteamento entre geografias. |
Como o pagamento por token prioritário se comporta
Considere o seguinte comportamento antes de usar o pagamento por token prioritário:
- Desempenho e disponibilidade consistentes O pagamento por token prioritário foi projetado para manter a disponibilidade consistente sob carga. Não garante um tempo específico até o primeiro token ou meta de latência de ponta a ponta. Solicitações prioritárias visam uma disponibilidade maior do que as solicitações padrão de pagamento por token. A Databricks define a disponibilidade em uma camada como o número de solicitações bem-sucedidas dividido pelo número total de solicitações admitidas naquela camada.
- Capacidade de melhor esforço . O modo de prioridade não reserva capacidade e não há compromisso de capacidade. Para capacidade garantida, use o throughput provisionado.
- **Fallback** para pagamento por token padrão. Se a capacidade prioritária estiver totalmente subscrita, as solicitações são atendidas com a disponibilidade padrão de pagamento por token e faturadas às taxas padrão de pagamento por token.
- **Premium por token**. As solicitações prioritárias são cobradas a uma taxa por token mais alta do que as solicitações padrão de pagamento por token.
Pagamento por tokens prioritário em comparação com o throughput provisionado
O pagamento prioritário por tokens e o throughput provisionado visam cargas de trabalho de produção, mas fazem diferentes compensações:
Consideração | Pagamento por token prioritário | Throughput provisionado |
|---|---|---|
Capacidade | Melhor esforço, compartilhado. | Capacidade dedicada e reservada. |
Compromisso | Nenhuma. Aceite por solicitação. | Exige um Endpoint provisionado. |
Disponibilidade | Mais consistente do que o pagamento por token padrão sob carga. | Previsível, com base na capacidade reservada. |
Cobrança | Por token, com um custo adicional em relação ao pagamento por token padrão. | Com base nas unidades de modelo provisionadas. |
Envie uma solicitação prioritária
Para usar o modo de prioridade, defina o parâmetro service_tier como "priority" por solicitação. O exemplo a seguir usa o cliente OpenAI:
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
Consulte Referência da API REST do Foundation Model para obter a sintaxe dos parâmetros e Usar modelos de fundação para obter mais opções de query.
Limites de capacidade
Cada cluster oferece suporte a um número total máximo de tokens por minuto em todos os tenants. A Databricks define um limite por tenant durante o onboarding para que um único tenant não possa consumir toda a capacidade do cluster. Se sua carga de trabalho exigir mais capacidade do que o limite por tenant permite, solicite throughput provisionada.
Para mais limites das APIs do Foundation Model, consulte limites e cotas das APIs do Foundation Model.