Pular para o conteúdo principal

Reservar throughput provisionado em APIs do Foundation Model

Esta página explica o throughput de provisionamento reservado para APIs do Foundation Model: o que é, quando usá-lo, como dimensionar uma reserva e como criar e gerenciar um Endpoint que o utiliza.

O que é throughput provisionado reservado?​

O throughput provisionado reservado é uma opção de capacidade para as APIs do Foundation Model do Databricks. Em vez de usar uma oferta por tokens, que utiliza um Pool compartilhado de capacidade, você reserva uma quantidade fixa de capacidade dedicada por um prazo definido. Você mede essa capacidade em unidades de modelo , e o Databricks a mantém para você durante a duração da reserva.

Como a capacidade é dedicada e reservada com antecedência, o throughput e a latência permanecem consistentes para essa capacidade, mesmo quando a demanda geral no pagamento por tokens compartilhado está alta. O tráfego acima da sua capacidade reservada é limitado por taxa, não sendo atendido automaticamente no pagamento por token. Para enviar esse excesso para o pagamento por token em vez de rejeitá-lo, configure um fallback no serviço de modelo à frente do seu endpoint. Consulte Lidar com o tráfego acima da sua capacidade reservada.

Quando usar o throughput provisionado reservado​

O throughput provisionamento reservado foi criado para cargas de trabalho que precisam de capacidade confiável em vez de acesso de melhor esforço a um Pool compartilhado. O Databricks o recomenda quando:

  • Você está alimentando uma aplicação ou agente essencial para os negócios, em que um recurso de produção depende do modelo e não pode competir com outro tráfego por capacidade compartilhada.
  • Você precisa de mais consistência em disponibilidade e tempo de atividade do que o pagamento por tokens compartilhado, para que a alta demanda no pool compartilhado tenha menos impacto no seu throughput.
  • Você está dimensionando para volumes altos ou sustentados de tráfego previsível e está atingindo restrições de capacidade ou de limite de taxa no pagamento por tokens ou no pagamento por tokens prioritário.

Se o seu tráfego for exploratório ou de baixo volume, consulte pagamento por tokens ou pagamento por tokens prioritário.

Modelos compatíveis​

O throughput provisionado reservado está disponível em modelos de fundação com suporte. A Databricks seleciona a elegibilidade por modelo, e o fluxo de criação mostra apenas os modelos que você pode reservar.

O throughput provisionado reservado está disponível para os seguintes modelos:

Provedor

Modelo

Nome do endpoint

Zhipu AI

GLM 5,3

databricks-glm-5-3

Zhipu AI

GLM 5.3 Flash

databricks-glm-5-3-flash

Zhipu AI

GLM 5.2 (legado)

databricks-glm-5-2

Moonshot AI

Kimi K3

databricks-kimi-k3

DeepSeek

DeepSeek V4.1 Flash

databricks-deepseek-v4-1-flash

Alibaba Cloud

Qwen3.5 122B A10B

databricks-qwen35-122b-a10b

Provedor

Modelo

Nome do endpoint

Zhipu AI

GLM 5,3

databricks-glm-5-3

Zhipu AI

GLM 5.3 Flash

databricks-glm-5-3-flash

Zhipu AI

GLM 5.2 (legado)

databricks-glm-5-2

Moonshot AI

Kimi K3

databricks-kimi-k3

DeepSeek

DeepSeek V4.1 Flash

databricks-deepseek-v4-1-flash

Alibaba Cloud

Qwen3.5 122B A10B

databricks-qwen35-122b-a10b

nota

O Qwen3.5 122B A10B está em Pré-lançamento público. Entre em contato com a equipe da sua account Databricks para habilitar o recurso.

Como funciona o throughput provisionado reservado​

Você reserva capacidade em unidades de modelo . Uma unidade de modelo é uma unidade de throughput provisionado que define a quantidade de trabalho que seu endpoint pode processar por minuto. Mais unidades de modelo significam mais throughput mantido para você. Você reserva unidades de modelo em incrementos de 50, começando com um mínimo de 50.

Você cria uma reserva escolhendo quantas unidades do modelo deseja reservar e por quanto tempo (o período ). O Databricks provisiona essa capacidade dedicada por todo o período. Um endpoint pode conter mais de uma reserva por vez, e sua capacidade total reservada é a soma das unidades do modelo em suas reservas ativas.

Os seguintes termos descrevem as partes de um endpoint de throughput provisionado reservado:

Termo

O que significa

Unidade de modelo

A unidade de capacidade provisionada. Mais unidades de modelo significam mais throughput reservado. Use o estimador de unidades de modelo para dimensionar seu pool com base no tráfego esperado.

Reserva

Uma concessão pré-paga de unidades do modelo e um período em um endpoint. Um endpoint pode conter várias reservas ao mesmo tempo, cada uma com suas próprias unidades do modelo e data de término do período.

Termo

A duração de uma reserva: 1 mês ou 3 meses. Um prazo mais longo tem uma taxa por unidade menor.

Cobertura

O total de unidades de modelo que as reservas ativas do seu endpoint somam.

fallback

Um destino de backup configurado no serviço de modelo para o tráfego acima da sua cobertura. O Databricks não roteia o tráfego para o pagamento por tokens automaticamente. Sem um fallback, o tráfego acima da sua cobertura tem a taxa limitada. Consulte Lidar com o tráfego acima da sua capacidade reservada.

Termo

O que significa

Unidade de modelo

A unidade de capacidade provisionada. Mais unidades de modelo significam mais throughput reservado. Use o estimador de unidades de modelo para dimensionar seu pool com base no tráfego esperado.

Reserva

Uma concessão pré-paga de unidades do modelo e um período em um endpoint. Um endpoint pode conter várias reservas ao mesmo tempo, cada uma com suas próprias unidades do modelo e data de término do período.

Termo

A duração de uma reserva: 1 mês ou 3 meses. Um prazo mais longo tem uma taxa por unidade menor.

Cobertura

O total de unidades de modelo que as reservas ativas do seu endpoint somam.

fallback

Um destino de backup configurado no serviço de modelo para o tráfego acima da sua cobertura. O Databricks não roteia o tráfego para o pagamento por tokens automaticamente. Sem um fallback, o tráfego acima da sua cobertura tem a taxa limitada. Consulte Lidar com o tráfego acima da sua capacidade reservada.

Decida quanto reservar​

Quantas unidades de modelo você reserva fica a seu critério. Você pode colocar toda a sua carga de trabalho em capacidade dedicada, ou reservar menos e enviar o excesso para o pagamento por tokens com um fallback (consulte Lidar com o tráfego acima da sua capacidade reservada):

  • Reserve uma linha de base e envie picos para um fallback. Reserve unidades de modelo suficientes para cobrir seu tráfego diário estável e configure um fallback para que os picos acima dessa linha de base sejam de execução no pagamento por token. Você se commit com menos capacidade e paga por tokens apenas pelo excedente, em troca de capacidade compartilhada de melhor esforço nesses picos.
  • Reserve para o seu pico. Reserve unidades de modelo suficientes para cobrir a maior carga esperada, para que toda a sua carga de trabalho entre em execução em capacidade dedicada. Isso oferece o comportamento mais consistente, em troca de um compromisso maior.

De qualquer forma, você traduz sua carga de trabalho em unidades de modelo com a ferramenta Estimate model units integrada no fluxo de criação. Insira o formato de solicitação esperado e o estimador retornará as unidades de modelo necessárias:

  • O número de solicitações por minuto esperado.
  • O número médio de tokens de entrada por solicitação.
  • O número médio de tokens de saída por solicitação.
  • A taxa de acerto de cache esperada.

Para dimensionar uma linha de base, insira seu tráfego típico. Para fazer reservas para o seu pico, insira o tráfego esperado mais intenso. Você pode executar o estimador quantas vezes quiser antes do commit.

Throughput provisionado reservado em comparação com pagamento por token​

O throughput provisionado reservado e o pagamento por token são complementares, e não excludentes. Você pode reservar capacidade dedicada para o seu tráfego principal e configurar um fallback para o pagamento por token para qualquer volume que exceda o seu pool reservado. A tabela a seguir mostra onde cada opção se encaixa.

Capacidade

Pagamento por token

Throughput provisionado reservado

Base de preços

Por token, conforme o uso

Capacidade reservada, cobrada pelo período integral

Capacidade

Pool compartilhado, melhor esforço

Pool dedicado, reservado para você

Latência sob carga

Pode variar com a demanda compartilhada

Consistente para capacidade reservada

Reserva

Nenhuma

1 ou 3 meses

Melhor para

Tráfego com picos, interno ou exploratório

Aplicações ou agentes externos de missão crítica em produção

Capacidade

Pagamento por token

Throughput provisionado reservado

Base de preços

Por token, conforme o uso

Capacidade reservada, cobrada pelo período integral

Capacidade

Pool compartilhado, melhor esforço

Pool dedicado, reservado para você

Latência sob carga

Pode variar com a demanda compartilhada

Consistente para capacidade reservada

Reserva

Nenhuma

1 ou 3 meses

Melhor para

Tráfego com picos, interno ou exploratório

Aplicações ou agentes externos de missão crítica em produção

Como funcionam os preços​

O throughput provisionado reservado é cobrado com base na capacidade que você reserva, não nas solicitações que você envia. Você é cobrado por toda a reserva durante todo o seu período, independentemente de usar a capacidade reservada.

O que acontece

Como é cobrado

Tráfego dentro da sua capacidade reservada

Cobrado como capacidade reservada pelo período integral.

Tráfego acima da capacidade reservada, com um fallback configurado

Pagamento por token apenas no excedente, faturado pelo destino de fallback.

Tráfego acima da sua capacidade reservada, sem fallback

Limitado por taxa, não cobrado.

Tráfego após a expiração de uma reserva

Tratado como qualquer tráfego acima da sua capacidade reservada: pagamento por token se você tiver configurado um fallback; caso contrário, limitado pela taxa.

O que acontece

Como é cobrado

Tráfego dentro da sua capacidade reservada

Cobrado como capacidade reservada pelo período integral.

Tráfego acima da capacidade reservada, com um fallback configurado

Pagamento por token apenas no excedente, faturado pelo destino de fallback.

Tráfego acima da sua capacidade reservada, sem fallback

Limitado por taxa, não cobrado.

Tráfego após a expiração de uma reserva

Tratado como qualquer tráfego acima da sua capacidade reservada: pagamento por token se você tiver configurado um fallback; caso contrário, limitado pela taxa.

  • Um prazo mais longo tem uma taxa por unidade menor do que um prazo mais curto.
  • Quando um endpoint mantém reservas de diferentes prazos ao mesmo tempo, cada uma é precificada de forma independente com sua própria taxa.
  • As taxas específicas dependem do modelo e do prazo.

Antes de começar​

Requisito

Detalhe

Permissão de modelo

Você precisa de MANAGE no modelo de base no Unity Catalog (o modelo registrado system.ai.<model>). Se você não a tiver, solicite a um administrador que a conceda no Explorador de Catálogo. Consulte Permissões do Unity Catalog para modelos de base.

Um modelo elegível

Você pode criar throughput provisionado reservado apenas em modelos qualificados. Consulte Modelos compatíveis.

Requisito

Detalhe

Permissão de modelo

Você precisa de MANAGE no modelo de base no Unity Catalog (o modelo registrado system.ai.<model>). Se você não a tiver, solicite a um administrador que a conceda no Explorador de Catálogo. Consulte Permissões do Unity Catalog para modelos de base.

Um modelo elegível

Você pode criar throughput provisionado reservado apenas em modelos qualificados. Consulte Modelos compatíveis.

Criar um endpoint de throughput provisionado reservado​

Você cria o throughput provisionado reservado no Unity Gateway.

  1. No Unity Gateway, selecione + Model .

  2. Nomeie o serviço de modelo.

  3. Para o Destination , escolha o throughput de provisionamento e, em seguida, selecione o Link para criar um novo Endpoint no Workspace. A caixa de diálogo Set up a provisionamento throughput Endpoint é aberta.

    Configurar uma caixa de diálogo de Endpoint de throughput com provisionamento, com um modelo de fundação, unidades de modelo e termo de reserva selecionados.

  4. Selecione um modelo básico qualificado.

  5. Defina suas unidades do modelo , em incrementos de 50. Para dimensionar o pool, selecione Estimar unidades do modelo , insira sua carga de trabalho esperada (requisições por minuto, média de tokens de entrada e saída por requisição e a taxa de acerto de cache esperada), e o estimador retornará as unidades do modelo necessárias. Consulte Decidir quanto reservar.

    Caixa de diálogo de estimativa de unidades do modelo com entradas de carga de trabalho e uma reserva recomendada de unidades do modelo.

  6. Escolha um prazo de reserva : 1 mês ou 3 meses. Um prazo mais longo tem uma taxa menor por unidade.

  7. Revise suas unidades de modelo e prazo e, em seguida, crie o endpoint. O Databricks faz o provisionamento da capacidade dedicada.

nota

O tipo de capacidade de um endpoint é fixo quando você o cria. Não é possível converter um endpoint existente para throughput provisionado reservado posteriormente. Crie um novo endpoint de throughput provisionado reservado.

Exibir e monitorar​

A página de detalhes do endpoint mostra uma seção Configuração ativa intitulada Throughput provisionado reservado que lista suas unidades de modelo reservadas e o período, a data de validade e o status de cada reserva. Quando um endpoint mantém várias reservas empilhadas, provenientes de aumentos de escala ou atualizações, elas aparecem como uma lista.

Visão geral do Endpoint de throughput de provisionamento reservado, mostrando o status e o prazo, as unidades de modelo e a expiração da reserva ativa.

A tab Métricas mostra a telemetria de serviço usual, incluindo solicitações por minuto, contagem de erros, latência (p50, p90, p95 e p99), contagem de tokens e tempo até o primeiro token, para que você possa monitorar o uso e decidir quando escalar.

Aumentar a capacidade​

Para adicionar capacidade, abra Edit > Add capacity , insira o número de unidades do modelo a serem adicionadas (em incrementos de 50) e escolha um termo. Isso cria uma nova reserva empilhada sobre as existentes. Isso não modifica nem interrompe o que você já possui. A página de detalhes lista cada reserva, com expiração em seu próprio cronograma.

Adicione a tab de capacidade na página Editar Endpoint de disponibilização, adicionando unidades do modelo em um novo período de reserva.

Expiração​

  • No vencimento, o pool reservado expira. O tráfego é tratado como qualquer tráfego acima da sua capacidade reservada: ele vai para o fallback de pagamento por token configurado ou tem a taxa limitada se você não tiver nenhum fallback. Consulte Gerenciar o tráfego acima da sua capacidade reservada.
  • Para manter a capacidade reservada após o término de um período, crie uma nova reserva antes que a atual expire. Consulte Aumentar a capacidade.
  • As reservas expiradas permanecem visíveis com um selo Expired e são retidas, não excluídas.

Lidar com o tráfego acima da sua capacidade reservada​

Um endpoint de throughput provisionado reservado atende ao tráfego apenas da sua capacidade reservada. O Databricks não roteia o excedente para pagamento por tokens automaticamente. Quando o tráfego excede sua capacidade reservada, seja devido a um pico ou porque uma reserva expirou, essas solicitações são rejeitadas com um erro de limite de taxa.

Para manter o atendimento desse estouro, configure um fallback no Unity Gateway model serviço em frente ao seu endpoint. Defina seu endpoint de throughput provisionado reservado como o destino principal e um endpoint de pagamento por tokens ou priority pay-per-tokens como o fallback. Quando o Endpoint reservado retornar um erro de limite de taxa, o serviço de modelo tentará novamente a solicitação no destino de fallback, para que sua carga de trabalho continue sendo executada e você pague por tokens apenas pelo excesso.

Para conhecer os passos de configuração, consulte Configurar roteamento e fallback para modelos.

Limitações​

  • Você pode criar um endpoint de throughput provisionado reservado por modelo, por workspace, na versão atual.
  • As reservas são pré-pagas e executadas durante todo o seu período. Não é possível cancelar uma reserva no meio do período.
  • Você não pode excluir um endpoint que tenha uma reserva ativa até que a reserva termine.
  • Usuários sem MANAGE no modelo veem views somente leitura.

Para obter mais limites das APIs do Foundation Model, consulte Limites e cotas das APIs do Foundation Model.

Outros recursos​