APIs de modèle de fondation avec throughput provisionné réservé
Cette page explique le throughput provisionné réservé pour les APIs de modèles de fondation et comment créer et gérer un endpoint qui l’utilise.
Qu’est-ce que le throughput provisionné réservé ?
Le throughput provisionné réservé est une option de capacité pour les API de modèles de fondation Databricks. Au lieu de payer au jeton à l’usage, vous réservez un pool fixe d’unités de modèle sur un seul modèle de fondation pour une durée déterminée. Databricks prend en charge ce pool avec une capacité dédiée pour la durée de la réservation.
Si votre trafic dépasse le pool réservé, le surplus est traité automatiquement en priorité avec le paiement au jeton et facturé en conséquence. Voir Comportement de dépassement de capacité.
Databricks recommande le throughput provisionné réservé lorsque vous devez alimenter une application ou un agent critique pour l'entreprise avec un throughput et une latence garantis et fiables, et que votre trafic est prévisible.
Modèles pris en charge
Le throughput provisionné réservé est disponible sur les modèles de fondation pris en charge. Databricks gère l'éligibilité par modèle, et le flux de création affiche uniquement les modèles que vous pouvez réserver.
Le throughput provisionné réservé est disponible pour les modèles suivants :
Concepts clés
Terme | Ce que cela signifie |
|---|---|
Unité de modèle | L’unité de capacité provisionnée. Plus d’unités de modèle signifient plus de throughput garanti. Utilisez l’estimateur d’unités de modèle pour dimensionner votre pool en fonction du trafic attendu. |
Réservation | Une allocation prépayée d'unités de modèle et une durée sur un endpoint. Un endpoint peut contenir plusieurs réservations à la fois, chacune avec ses propres unités de modèle et sa propre date de fin de durée. |
Terme | La durée d’une réservation : 1 mois ou 3 mois. Une durée plus longue entraîne un tarif par unité plus bas. |
Couverture | Le nombre total d’unités de modèle cumulées par les réservations actives de votre Endpoint. |
Dépassement de capacité | Trafic au-delà de votre couverture. Il est servi automatiquement en priorité via le paiement par jeton au lieu d’être rejeté, dans la limite de vos plafonds de paiement par jeton. Le dépassement de capacité est activé automatiquement. |
Comparaison entre le throughput provisionné réservé et le paiement au jeton
Le throughput provisionné réservé et le paiement au jeton sont complémentaires, et non exclusifs. Un endpoint de throughput provisionné réservé utilise automatiquement le paiement au jeton prioritaire pour tout trafic dépassant son pool réservé. Le tableau suivant montre où chaque option s'inscrit.
Compétence | Paiement par jeton | Throughput provisionné réservé |
|---|---|---|
Base de tarification | Par jeton, selon l'utilisation | Capacité réservée, facturée pour la durée totale |
Garantie de capacité | Pool partagé, au mieux | Pool dédié, réservé pour vous |
Latence sous charge | Peut varier en fonction de la demande partagée | Cohérent pour la capacité réservée |
Réservation | Aucun | 1 ou 3 mois |
Idéal pour | Trafic en dents de scie, interne ou exploratoire | Applications ou agents externes critiques pour l’entreprise en production |
Fonctionnement des tarifs
Le throughput provisionné réservé est facturé sur la capacité que vous réservez, et non sur les requêtes que vous envoyez. Vous êtes facturé pour l’intégralité de la réservation sur toute sa durée, que vous utilisiez ou non la capacité réservée.
Que se passe-t-il | Comment cela est facturé |
|---|---|
Trafic au sein de votre capacité réservée | Facturé en tant que capacité réservée pour la durée totale. |
Dépassement de capacité au-delà de votre capacité réservée | Paiement par jeton prioritaire sur le dépassement uniquement. |
Trafic après l’expiration d’une réservation | Paiement par jeton prioritaire. L’endpoint continue de servir, sans pool réservé. |
- Une durée plus longue entraîne un tarif unitaire inférieur à une durée plus courte.
- Lorsqu'un endpoint détient simultanément des réservations de durées différentes, chacune est tarifée indépendamment à son propre taux.
- Les tarifs spécifiques dépendent du modèle et de la durée.
Avant de start
Exigence | Détail |
|---|---|
Autorisation de modèle | Vous avez besoin de |
Un modèle éligible | Vous pouvez créer un throughput provisionné réservé uniquement sur les modèles éligibles. Consultez Modèles pris en charge. |
Créer un endpoint de throughput provisionné réservé
Vous créez un throughput provisionné réservé à partir de la page Serving .
- Accédez à la page Serving et commencez à créer un endpoint.
- Ajoutez une entité servie et sélectionnez un modèle de fondation éligible. Lorsque le modèle prend en charge le throughput provisionné réservé, l’option Throughput provisionné réservé s’affiche.
- Définissez vos unités de modèle . Utilisez l’estimateur d’unités de modèle pour dimensionner le pool : saisissez la forme de requête attendue — le nombre moyen de jetons d’entrée et de sortie par requête, le nombre de requêtes simultanées prévues et votre taux de réussite de cache attendu — et l’estimateur renverra les unités de modèle dont vous avez besoin.
- Choisissez une durée de réservation : 1 mois ou 3 mois.
- Créez l’endpoint. Databricks assure le provisionnement de la capacité dédiée.
Le type de capacité d'un endpoint est fixe lors de sa création. Vous ne pouvez pas convertir ultérieurement un endpoint existant en throughput provisionné réservé. Créez plutôt un nouvel endpoint de throughput provisionné réservé.
Afficher et superviser
La page de détails de l’endpoint affiche une section Configuration active intitulée Throughput provisionné réservé qui répertorie vos unités de modèle réservées ainsi que la durée, la date d’expiration et le statut de chaque réservation. Lorsqu’un endpoint contient plusieurs réservations empilées, issues de montées en charge ou de mises à niveau, elles apparaissent sous forme de liste.
L’onglet Metrics affiche la télémétrie de service habituelle, notamment les requêtes par minute, le nombre d’erreurs, la latence (p50, p90, p95 et p99), le nombre de jetons et le temps jusqu’au premier jeton (TTFT), afin que vous puissiez surveiller l’utilisation et décider quand monter en charge.
Monter en charge la capacité
Pour ajouter de la capacité, ouvrez Edit > Add capacity , saisissez le nombre d’unités de modèle à ajouter et choisissez une durée. Ceci crée une nouvelle réservation cumulée à celles existantes. Cela ne modifie ni n’interrompt ce que vous avez déjà. La page de détails liste ensuite chaque réservation, expirant selon son propre calendrier.
Expiration
- À l’expiration, le pool réservé prend fin et l’endpoint continue de servir avec une priorité de paiement par jeton. Il s’agit d’un fallback, pas d’une interruption de service.
- Pour conserver la capacité réservée après la fin d’une durée, créez une nouvelle réservation avant l’expiration de la réservation actuelle. Voir Monter en charge la capacité.
- Les réservations expirées restent visibles avec un badge Expiré et sont conservées, non supprimées.
Comportement de dépassement de capacité
Le dépassement est activé automatiquement ; il n’y a rien à configurer. Lorsque le trafic dépasse votre capacité réservée, que ce soit en raison d’un pic ou de l’expiration d’une réservation, ces requêtes sont automatiquement traitées via le paiement au jeton prioritaire au lieu d’être rejetées avec une erreur de limitation de débit. Votre charge de travail continue de s’exécuter et vous ne payez qu’au jeton pour le dépassement. Les requêtes de dépassement sont limitées par les plafonds de débit du paiement au jeton.
Limitations
- Vous pouvez créer un endpoint de throughput provisionné réservé par modèle et par Workspace dans la version actuelle.
- Les réservations sont prépayées et courent sur toute leur durée. Vous ne pouvez pas annuler une réservation en cours de route.
- Vous ne pouvez pas supprimer un endpoint disposant d'une réservation active tant que celle-ci n'est pas terminée.
- Les utilisateurs sans
MANAGEsur le modèle voient des vues en lecture seule.
Pour plus d'informations sur les limites des APIs de modèle de fondation, consultez Limites et quotas des APIs de modèle de fondation.