Réserver le throughput provisionné sur les APIs de modèles de fondation
Cette page explique le throughput provisionné réservé pour les APIs Foundation Model: de quoi il s'agit, quand l'utiliser, comment dimensionner une réservation, ainsi que la création et la gestion d'un endpoint qui l'utilise.
Qu’est-ce que le throughput provisionné réservé ?
Le throughput provisionné réservé est une option de capacité pour les Foundation Model APIs Databricks. Au lieu d'utiliser une offre par jeton, qui puise dans un pool de capacité partagé, vous réservez une quantité fixe de capacité dédiée pour une durée déterminée. Vous mesurez cette capacité en unités de modèle , et Databricks la conserve pour vous pendant toute la durée de la réservation.
Étant donné que la capacité est dédiée et réservée à l’avance, le throughput et la latence restent constants pour cette capacité, même lorsque la demande globale sur le paiement au jeton partagé est élevée. Le trafic dépassant votre capacité réservée fait l’objet d’une limitation du taux et n’est pas traité automatiquement sur le paiement au jeton. Pour envoyer ce surplus vers le paiement au jeton au lieu de le rejeter, configurez un fallback sur le service de modèle situé en amont de votre Endpoint. Consultez la section Gérer le trafic dépassant votre capacité réservée.
Quand utiliser un throughput provisionné réservé
Le throughput provisionné réservé est conçu pour les workloads qui nécessitent une capacité fiable plutôt qu'un accès au mieux de ses capacités à un pool partagé. Databricks le recommande lorsque :
- Vous alimentez une application ou un agent critique pour l'activité, où une fonctionnalité de production dépend du modèle et ne peut pas concurrencer d'autres trafics pour obtenir de la capacité partagée.
- Vous avez besoin d'une disponibilité et d'une durée de fonctionnement plus constantes que le paiement par jeton partagé, de sorte qu'une forte demande sur le pool partagé ait moins d'impact sur votre throughput.
- Vous effectuez une mise à l'échelle vers des volumes élevés ou soutenus de trafic prévisible et vous vous heurtez à des limites de capacité ou de taux sur le paiement au jeton ou le paiement au jeton prioritaire.
Si votre trafic est exploratoire ou de faible volume, consultez la page paiement par jeton ou paiement au jeton prioritaire.
Modèles pris en charge
Le throughput provisionné réservé est disponible sur les modèles de fondation pris en charge. Databricks gère l'éligibilité par modèle, et le flux de création affiche uniquement les modèles que vous pouvez réserver.
Le throughput provisionné réservé est disponible pour les modèles suivants :
Fournisseur | Modèle | Endpoint name |
|---|---|---|
Zhipu AI |
| |
Zhipu AI |
| |
Zhipu AI |
| |
Moonshot AI |
| |
DeepSeek |
| |
Alibaba Cloud |
|
Qwen3.5 122B A10B est en préversion publique. Contactez l'équipe de votre compte Databricks pour l'activation.
Comment fonctionne le throughput provisionné réservé
Vous réservez de la capacité en unités de modèle . Une unité de modèle est une unité de throughput de provisionnement qui détermine la quantité de travail que votre Endpoint peut gérer par minute. Plus vous avez d'unités de modèle, plus le throughput réservé pour vous est important. Vous réservez des unités de modèle par incréments de 50, à partir d'un minimum de 50.
You create a reservation by choosing how many model units to reserve and for how long (the term ). Databricks provisions that dedicated capacity for the full term. An endpoint can hold more than one reservation at a time, and its total reserved capacity is the sum of the model units across its active reservations.
Les termes suivants décrivent les éléments d’un Endpoint de throughput de provisionnement réservé :
Terme | Ce que cela signifie |
|---|---|
Unité de modèle | L'unité de capacité provisionnée. Plus d'unités de modèle signifie plus de throughput réservé. Utilisez l'estimateur d'unités de modèle pour dimensionner votre pool en fonction de votre trafic prévu. |
Réservation | One prepaid grant of model units and a term on an endpoint. An endpoint can hold several reservations at the same time, each with its own model units and term-end date. |
Terme | La durée d’une réservation : 1 mois ou 3 mois. Une durée plus longue entraîne un tarif par unité plus bas. |
Couverture | Le nombre total d’unités de modèle cumulées par les réservations actives de votre Endpoint. |
fallback | Destination de secours que vous configurez sur le service de modèle pour le trafic excédant votre couverture. Databricks n’achemine pas automatiquement le trafic vers le paiement par jeton. Sans fallback, le trafic supérieur à votre couverture fait l’objet d’une limitation de débit. Voir Gérer le trafic excédant votre capacité réservée. |
Décider du montant à réserver
Le nombre d'unités de modèle que vous réservez dépend de vous. Vous pouvez placer l'ensemble de votre charge de travail sur une capacité dédiée, ou en réserver moins et envoyer le surplus vers le paiement à l'utilisation avec un fallback (voir Gérer le trafic excédant votre capacité réservée) :
- Réservez une base de référence et envoyez les pics vers un fallback. Réservez suffisamment d'unités de modèle pour couvrir votre trafic quotidien et régulier, et configurez un fallback afin que les pics supérieurs à cette base de référence soient exécutés en mode paiement par jeton. Vous vous commit sur une capacité moindre et payez au jeton uniquement pour le dépassement, en échange d'une capacité partagée au mieux sur ces pics.
- Réservez pour votre pic de charge. Réservez suffisamment d’unités de modèle pour couvrir votre charge maximale prévisionnelle, afin que l’ensemble de votre charge de travail s’exécute sur une capacité dédiée. Vous bénéficiez ainsi d’un comportement plus cohérent, en échange d’un engagement plus important.
Dans les deux cas, vous traduisez votre charge de travail en unités de modèle à l'aide de l'outil intégré Estimer les unités de modèle dans le flux de création. Saisissez la forme de requête attendue et l'estimateur renvoie les unités de modèle dont vous avez besoin :
- Le nombre de requêtes par minute que vous prévoyez.
- Le nombre moyen de jetons d'entrée par requête.
- Le nombre moyen de jetons de sortie par requête.
- Votre taux de réussite du cache attendu.
Pour dimensionner une base de référence, saisissez votre trafic habituel. Pour réserver en fonction de vos pics, saisissez le trafic maximal attendu. Vous pouvez exécuter l’estimateur autant de fois que vous le souhaitez avant de faire un commit.
Throughput provisionné réservé par rapport au paiement au jeton
Le throughput de provisionnement réservé et le paiement au jeton sont complémentaires, et non exclusifs. Vous pouvez réserver une capacité dédiée pour votre trafic principal et configurer un fallback vers le paiement au jeton pour tout ce qui dépasse votre pool réservé. Le tableau suivant indique où chaque option s'applique.
Compétence | Paiement par jeton | Throughput provisionné réservé |
|---|---|---|
Base de tarification | Par jeton, selon l'utilisation | Capacité réservée, facturée pour la durée totale |
Capacité | Pool partagé, au mieux | Pool dédié, réservé pour vous |
Latence sous charge | Peut varier en fonction de la demande partagée | Cohérent pour la capacité réservée |
Réservation | Aucun | 1 ou 3 mois |
Idéal pour | Trafic en dents de scie, interne ou exploratoire | Applications ou agents externes critiques pour l’entreprise en production |
Fonctionnement des tarifs
Le throughput provisionné réservé est facturé sur la capacité que vous réservez, et non sur les requêtes que vous envoyez. Vous êtes facturé pour l’intégralité de la réservation sur toute sa durée, que vous utilisiez ou non la capacité réservée.
Que se passe-t-il | Comment cela est facturé |
|---|---|
Trafic au sein de votre capacité réservée | Facturé en tant que capacité réservée pour la durée totale. |
Trafic dépassant votre capacité réservée, avec un fallback configuré | Paiement au jeton uniquement sur le dépassement, facturé par la destination de fallback. |
Trafic supérieur à votre capacité réservée, sans fallback | Limité par le débit, non facturé. |
Trafic après l’expiration d’une réservation | Traité comme tout trafic dépassant votre capacité réservée : paiement au jeton si vous avez configuré un fallback, sinon limitation du débit. |
- Une durée plus longue entraîne un tarif unitaire inférieur à une durée plus courte.
- Lorsqu’un endpoint détient des réservations de durées différentes en même temps, chacune est tarifée indépendamment à son propre taux.
- Les tarifs spécifiques dépendent du modèle et de la durée.
Avant de start
Exigence | Détail |
|---|---|
Autorisation de modèle | Vous avez besoin de |
Un modèle éligible | Vous pouvez créer un throughput provisionné réservé uniquement sur les modèles éligibles. Consultez Modèles pris en charge. |
Créer un endpoint de throughput provisionné réservé
Vous créez du throughput provisionné réservé à partir de Unity Gateway.
-
Dans Unity Gateway, sélectionnez + Model .
-
Nommez le service de modèle.
-
Pour la Destination , choisissez le throughput provisionné, puis sélectionnez le Link pour créer un nouveau serving endpoint dans le workspace. La boîte de dialogue Set up a provisionnement throughput Endpoint s'ouvre.

-
Sélectionner un modèle de fondation éligible.
-
Définissez vos unités de modèle par incréments de 50. Pour dimensionner le pool, sélectionnez Estimate model units , saisissez votre charge de travail prévue (requêtes par minute, jetons d'entrée et de sortie moyens par requête et taux de réussite du cache prévu), et l'estimateur renvoie les unités de modèle dont vous avez besoin. Consultez Decide how much to reserve.

-
Choisissez un terme de réservation : 1 mois ou 3 mois. Une durée plus longue offre un tarif unitaire inférieur.
-
Examinez vos unités de modèle et votre durée, puis créez l'endpoint. Databricks provisionne la capacité dédiée.
Le type de capacité d'un endpoint est fixe lors de sa création. Vous ne pouvez pas convertir ultérieurement un endpoint existant en throughput provisionné réservé. Créez plutôt un nouvel endpoint de throughput provisionné réservé.
Afficher et superviser
La page de détails de l’endpoint affiche une section Configuration active intitulée Throughput provisionné réservé qui répertorie vos unités de modèle réservées ainsi que la durée, la date d’expiration et le statut de chaque réservation. Lorsqu’un endpoint contient plusieurs réservations empilées, issues de montées en charge ou de mises à niveau, elles apparaissent sous forme de liste.

L’onglet Metrics affiche la télémétrie de service habituelle, notamment les requêtes par minute, le nombre d’erreurs, la latence (p50, p90, p95 et p99), le nombre de jetons et le temps jusqu’au premier jeton (TTFT), afin que vous puissiez surveiller l’utilisation et décider quand monter en charge.
Monter en charge la capacité
Pour ajouter de la capacité, ouvrez Edit > Add capacity , saisissez le nombre d'unités de modèle à ajouter (par incréments de 50) et choisissez un terme. Cela crée une nouvelle réservation superposée à vos réservations existantes. Cela ne modifie ni n’interrompt ce que vous avez déjà. La page de détails répertorie ensuite chaque réservation, qui expire selon son propre calendrier.

Expiration
- À l’expiration, le pool réservé prend fin. Le trafic est ensuite traité comme n’importe quel trafic dépassant votre capacité réservée : il est acheminé vers votre fallback de paiement par jeton configuré, ou fait l’objet d’une limitation du taux si vous n’avez aucun fallback. Consultez Traiter le trafic dépassant votre capacité réservée.
- Pour conserver la capacité réservée après la fin d’une durée, créez une nouvelle réservation avant l’expiration de la réservation actuelle. Voir Monter en charge la capacité.
- Les réservations expirées restent visibles avec un badge Expiré et sont conservées, non supprimées.
Gérer le trafic supérieur à votre capacité réservée
Un endpoint de throughput provisionné réservé dessert uniquement le trafic provenant de votre capacité réservée. Databricks ne route pas automatiquement le surplus vers le paiement par jeton. Lorsque le trafic dépasse votre capacité réservée, qu’il s’agisse d’un pic ou de l’expiration d’une réservation, ces requêtes sont rejetées avec une erreur de limitation du taux.
Pour continuer à desservir ce dépassement, configurez un fallback sur le service de modèle Unity Gateway devant votre endpoint. Définissez votre endpoint de throughput provisionné réservé comme destination principale et un endpoint de paiement au jeton ou de paiement prioritaire par jeton comme fallback. Lorsque l'endpoint réservé renvoie une erreur de limitation du débit, le service de modèle réessaie la requête auprès de la destination de fallback, de sorte que votre workload continue de s'exécuter et que vous ne payez au jeton que pour le dépassement.
Pour connaître les étapes de configuration, consultez Configurer le routage et les fallback pour les modèles.
Limitations
- Vous pouvez créer un endpoint de throughput provisionné réservé par modèle et par Workspace dans la version actuelle.
- Les réservations sont prépayées et courent sur toute leur durée. Vous ne pouvez pas annuler une réservation en cours de route.
- Vous ne pouvez pas supprimer un endpoint disposant d'une réservation active tant que celle-ci n'est pas terminée.
- Les utilisateurs sans
MANAGEsur le modèle voient des vues en lecture seule.
Pour plus d'informations sur les limites des APIs de modèle de fondation, consultez Limites et quotas des APIs de modèle de fondation.