Reservar throughput provisionado em APIs do Foundation Model
Esta página explica o throughput de provisionamento reservado para APIs do Foundation Model: o que é, quando usá-lo, como dimensionar uma reserva e como criar e gerenciar um Endpoint que o utiliza.
O que é throughput provisionado reservado?
O throughput provisionado reservado é uma opção de capacidade para as APIs do Foundation Model do Databricks. Em vez de usar uma oferta por tokens, que utiliza um Pool compartilhado de capacidade, você reserva uma quantidade fixa de capacidade dedicada por um prazo definido. Você mede essa capacidade em unidades de modelo , e o Databricks a mantém para você durante a duração da reserva.
Como a capacidade é dedicada e reservada com antecedência, o throughput e a latência permanecem consistentes para essa capacidade, mesmo quando a demanda geral no pagamento por tokens compartilhado está alta. O tráfego acima da sua capacidade reservada é limitado por taxa, não sendo atendido automaticamente no pagamento por token. Para enviar esse excesso para o pagamento por token em vez de rejeitá-lo, configure um fallback no serviço de modelo à frente do seu endpoint. Consulte Lidar com o tráfego acima da sua capacidade reservada.
Quando usar o throughput provisionado reservado
O throughput provisionamento reservado foi criado para cargas de trabalho que precisam de capacidade confiável em vez de acesso de melhor esforço a um Pool compartilhado. O Databricks o recomenda quando:
- Você está alimentando uma aplicação ou agente essencial para os negócios, em que um recurso de produção depende do modelo e não pode competir com outro tráfego por capacidade compartilhada.
- Você precisa de mais consistência em disponibilidade e tempo de atividade do que o pagamento por tokens compartilhado, para que a alta demanda no pool compartilhado tenha menos impacto no seu throughput.
- Você está dimensionando para volumes altos ou sustentados de tráfego previsível e está atingindo restrições de capacidade ou de limite de taxa no pagamento por tokens ou no pagamento por tokens prioritário.
Se o seu tráfego for exploratório ou de baixo volume, consulte pagamento por tokens ou pagamento por tokens prioritário.
Modelos compatíveis
O throughput provisionado reservado está disponível em modelos de fundação com suporte. A Databricks seleciona a elegibilidade por modelo, e o fluxo de criação mostra apenas os modelos que você pode reservar.
O throughput provisionado reservado está disponível para os seguintes modelos:
Provedor | Modelo | Nome do endpoint |
|---|---|---|
Zhipu AI |
| |
Zhipu AI |
| |
Zhipu AI |
| |
Moonshot AI |
| |
DeepSeek |
| |
Alibaba Cloud |
|
O Qwen3.5 122B A10B está em Pré-lançamento público. Entre em contato com a equipe da sua account Databricks para habilitar o recurso.
Como funciona o throughput provisionado reservado
Você reserva capacidade em unidades de modelo . Uma unidade de modelo é uma unidade de throughput provisionado que define a quantidade de trabalho que seu endpoint pode processar por minuto. Mais unidades de modelo significam mais throughput mantido para você. Você reserva unidades de modelo em incrementos de 50, começando com um mínimo de 50.
Você cria uma reserva escolhendo quantas unidades do modelo deseja reservar e por quanto tempo (o período ). O Databricks provisiona essa capacidade dedicada por todo o período. Um endpoint pode conter mais de uma reserva por vez, e sua capacidade total reservada é a soma das unidades do modelo em suas reservas ativas.
Os seguintes termos descrevem as partes de um endpoint de throughput provisionado reservado:
Termo | O que significa |
|---|---|
Unidade de modelo | A unidade de capacidade provisionada. Mais unidades de modelo significam mais throughput reservado. Use o estimador de unidades de modelo para dimensionar seu pool com base no tráfego esperado. |
Reserva | Uma concessão pré-paga de unidades do modelo e um período em um endpoint. Um endpoint pode conter várias reservas ao mesmo tempo, cada uma com suas próprias unidades do modelo e data de término do período. |
Termo | A duração de uma reserva: 1 mês ou 3 meses. Um prazo mais longo tem uma taxa por unidade menor. |
Cobertura | O total de unidades de modelo que as reservas ativas do seu endpoint somam. |
fallback | Um destino de backup configurado no serviço de modelo para o tráfego acima da sua cobertura. O Databricks não roteia o tráfego para o pagamento por tokens automaticamente. Sem um fallback, o tráfego acima da sua cobertura tem a taxa limitada. Consulte Lidar com o tráfego acima da sua capacidade reservada. |
Decida quanto reservar
Quantas unidades de modelo você reserva fica a seu critério. Você pode colocar toda a sua carga de trabalho em capacidade dedicada, ou reservar menos e enviar o excesso para o pagamento por tokens com um fallback (consulte Lidar com o tráfego acima da sua capacidade reservada):
- Reserve uma linha de base e envie picos para um fallback. Reserve unidades de modelo suficientes para cobrir seu tráfego diário estável e configure um fallback para que os picos acima dessa linha de base sejam de execução no pagamento por token. Você se commit com menos capacidade e paga por tokens apenas pelo excedente, em troca de capacidade compartilhada de melhor esforço nesses picos.
- Reserve para o seu pico. Reserve unidades de modelo suficientes para cobrir a maior carga esperada, para que toda a sua carga de trabalho entre em execução em capacidade dedicada. Isso oferece o comportamento mais consistente, em troca de um compromisso maior.
De qualquer forma, você traduz sua carga de trabalho em unidades de modelo com a ferramenta Estimate model units integrada no fluxo de criação. Insira o formato de solicitação esperado e o estimador retornará as unidades de modelo necessárias:
- O número de solicitações por minuto esperado.
- O número médio de tokens de entrada por solicitação.
- O número médio de tokens de saída por solicitação.
- A taxa de acerto de cache esperada.
Para dimensionar uma linha de base, insira seu tráfego típico. Para fazer reservas para o seu pico, insira o tráfego esperado mais intenso. Você pode executar o estimador quantas vezes quiser antes do commit.
Throughput provisionado reservado em comparação com pagamento por token
O throughput provisionado reservado e o pagamento por token são complementares, e não excludentes. Você pode reservar capacidade dedicada para o seu tráfego principal e configurar um fallback para o pagamento por token para qualquer volume que exceda o seu pool reservado. A tabela a seguir mostra onde cada opção se encaixa.
Capacidade | Pagamento por token | Throughput provisionado reservado |
|---|---|---|
Base de preços | Por token, conforme o uso | Capacidade reservada, cobrada pelo período integral |
Capacidade | Pool compartilhado, melhor esforço | Pool dedicado, reservado para você |
Latência sob carga | Pode variar com a demanda compartilhada | Consistente para capacidade reservada |
Reserva | Nenhuma | 1 ou 3 meses |
Melhor para | Tráfego com picos, interno ou exploratório | Aplicações ou agentes externos de missão crítica em produção |
Como funcionam os preços
O throughput provisionado reservado é cobrado com base na capacidade que você reserva, não nas solicitações que você envia. Você é cobrado por toda a reserva durante todo o seu período, independentemente de usar a capacidade reservada.
O que acontece | Como é cobrado |
|---|---|
Tráfego dentro da sua capacidade reservada | Cobrado como capacidade reservada pelo período integral. |
Tráfego acima da capacidade reservada, com um fallback configurado | Pagamento por token apenas no excedente, faturado pelo destino de fallback. |
Tráfego acima da sua capacidade reservada, sem fallback | Limitado por taxa, não cobrado. |
Tráfego após a expiração de uma reserva | Tratado como qualquer tráfego acima da sua capacidade reservada: pagamento por token se você tiver configurado um fallback; caso contrário, limitado pela taxa. |
- Um prazo mais longo tem uma taxa por unidade menor do que um prazo mais curto.
- Quando um endpoint mantém reservas de diferentes prazos ao mesmo tempo, cada uma é precificada de forma independente com sua própria taxa.
- As taxas específicas dependem do modelo e do prazo.
Antes de começar
Requisito | Detalhe |
|---|---|
Permissão de modelo | Você precisa de |
Um modelo elegível | Você pode criar throughput provisionado reservado apenas em modelos qualificados. Consulte Modelos compatíveis. |
Criar um endpoint de throughput provisionado reservado
Você cria o throughput provisionado reservado no Unity Gateway.
-
No Unity Gateway, selecione + Model .
-
Nomeie o serviço de modelo.
-
Para o Destination , escolha o throughput de provisionamento e, em seguida, selecione o Link para criar um novo Endpoint no Workspace. A caixa de diálogo Set up a provisionamento throughput Endpoint é aberta.

-
Selecione um modelo básico qualificado.
-
Defina suas unidades do modelo , em incrementos de 50. Para dimensionar o pool, selecione Estimar unidades do modelo , insira sua carga de trabalho esperada (requisições por minuto, média de tokens de entrada e saída por requisição e a taxa de acerto de cache esperada), e o estimador retornará as unidades do modelo necessárias. Consulte Decidir quanto reservar.

-
Escolha um prazo de reserva : 1 mês ou 3 meses. Um prazo mais longo tem uma taxa menor por unidade.
-
Revise suas unidades de modelo e prazo e, em seguida, crie o endpoint. O Databricks faz o provisionamento da capacidade dedicada.
O tipo de capacidade de um endpoint é fixo quando você o cria. Não é possível converter um endpoint existente para throughput provisionado reservado posteriormente. Crie um novo endpoint de throughput provisionado reservado.
Exibir e monitorar
A página de detalhes do endpoint mostra uma seção Configuração ativa intitulada Throughput provisionado reservado que lista suas unidades de modelo reservadas e o período, a data de validade e o status de cada reserva. Quando um endpoint mantém várias reservas empilhadas, provenientes de aumentos de escala ou atualizações, elas aparecem como uma lista.

A tab Métricas mostra a telemetria de serviço usual, incluindo solicitações por minuto, contagem de erros, latência (p50, p90, p95 e p99), contagem de tokens e tempo até o primeiro token, para que você possa monitorar o uso e decidir quando escalar.
Aumentar a capacidade
Para adicionar capacidade, abra Edit > Add capacity , insira o número de unidades do modelo a serem adicionadas (em incrementos de 50) e escolha um termo. Isso cria uma nova reserva empilhada sobre as existentes. Isso não modifica nem interrompe o que você já possui. A página de detalhes lista cada reserva, com expiração em seu próprio cronograma.

Expiração
- No vencimento, o pool reservado expira. O tráfego é tratado como qualquer tráfego acima da sua capacidade reservada: ele vai para o fallback de pagamento por token configurado ou tem a taxa limitada se você não tiver nenhum fallback. Consulte Gerenciar o tráfego acima da sua capacidade reservada.
- Para manter a capacidade reservada após o término de um período, crie uma nova reserva antes que a atual expire. Consulte Aumentar a capacidade.
- As reservas expiradas permanecem visíveis com um selo Expired e são retidas, não excluídas.
Lidar com o tráfego acima da sua capacidade reservada
Um endpoint de throughput provisionado reservado atende ao tráfego apenas da sua capacidade reservada. O Databricks não roteia o excedente para pagamento por tokens automaticamente. Quando o tráfego excede sua capacidade reservada, seja devido a um pico ou porque uma reserva expirou, essas solicitações são rejeitadas com um erro de limite de taxa.
Para manter o atendimento desse estouro, configure um fallback no Unity Gateway model serviço em frente ao seu endpoint. Defina seu endpoint de throughput provisionado reservado como o destino principal e um endpoint de pagamento por tokens ou priority pay-per-tokens como o fallback. Quando o Endpoint reservado retornar um erro de limite de taxa, o serviço de modelo tentará novamente a solicitação no destino de fallback, para que sua carga de trabalho continue sendo executada e você pague por tokens apenas pelo excesso.
Para conhecer os passos de configuração, consulte Configurar roteamento e fallback para modelos.
Limitações
- Você pode criar um endpoint de throughput provisionado reservado por modelo, por workspace, na versão atual.
- As reservas são pré-pagas e executadas durante todo o seu período. Não é possível cancelar uma reserva no meio do período.
- Você não pode excluir um endpoint que tenha uma reserva ativa até que a reserva termine.
- Usuários sem
MANAGEno modelo veem views somente leitura.
Para obter mais limites das APIs do Foundation Model, consulte Limites e cotas das APIs do Foundation Model.