Aller au contenu principal

APIs de modèle de fondation avec throughput provisionné réservé

Cette page explique le throughput provisionné réservé pour les APIs de modèles de fondation et comment créer et gérer un endpoint qui l’utilise.

Qu’est-ce que le throughput provisionné réservé ?

Le throughput provisionné réservé est une option de capacité pour les API de modèles de fondation Databricks. Au lieu de payer au jeton à l’usage, vous réservez un pool fixe d’unités de modèle sur un seul modèle de fondation pour une durée déterminée. Databricks prend en charge ce pool avec une capacité dédiée pour la durée de la réservation.

Si votre trafic dépasse le pool réservé, le surplus est traité automatiquement en priorité avec le paiement au jeton et facturé en conséquence. Voir Comportement de dépassement de capacité.

Databricks recommande le throughput provisionné réservé lorsque vous devez alimenter une application ou un agent critique pour l'entreprise avec un throughput et une latence garantis et fiables, et que votre trafic est prévisible.

Modèles pris en charge

Le throughput provisionné réservé est disponible sur les modèles de fondation pris en charge. Databricks gère l'éligibilité par modèle, et le flux de création affiche uniquement les modèles que vous pouvez réserver.

Le throughput provisionné réservé est disponible pour les modèles suivants :

Concepts clés

Terme

Ce que cela signifie

Unité de modèle

L’unité de capacité provisionnée. Plus d’unités de modèle signifient plus de throughput garanti. Utilisez l’estimateur d’unités de modèle pour dimensionner votre pool en fonction du trafic attendu.

Réservation

Une allocation prépayée d'unités de modèle et une durée sur un endpoint. Un endpoint peut contenir plusieurs réservations à la fois, chacune avec ses propres unités de modèle et sa propre date de fin de durée.

Terme

La durée d’une réservation : 1 mois ou 3 mois. Une durée plus longue entraîne un tarif par unité plus bas.

Couverture

Le nombre total d’unités de modèle cumulées par les réservations actives de votre Endpoint.

Dépassement de capacité

Trafic au-delà de votre couverture. Il est servi automatiquement en priorité via le paiement par jeton au lieu d’être rejeté, dans la limite de vos plafonds de paiement par jeton. Le dépassement de capacité est activé automatiquement.

Terme

Ce que cela signifie

Unité de modèle

L’unité de capacité provisionnée. Plus d’unités de modèle signifient plus de throughput garanti. Utilisez l’estimateur d’unités de modèle pour dimensionner votre pool en fonction du trafic attendu.

Réservation

Une allocation prépayée d'unités de modèle et une durée sur un endpoint. Un endpoint peut contenir plusieurs réservations à la fois, chacune avec ses propres unités de modèle et sa propre date de fin de durée.

Terme

La durée d’une réservation : 1 mois ou 3 mois. Une durée plus longue entraîne un tarif par unité plus bas.

Couverture

Le nombre total d’unités de modèle cumulées par les réservations actives de votre Endpoint.

Dépassement de capacité

Trafic au-delà de votre couverture. Il est servi automatiquement en priorité via le paiement par jeton au lieu d’être rejeté, dans la limite de vos plafonds de paiement par jeton. Le dépassement de capacité est activé automatiquement.

Comparaison entre le throughput provisionné réservé et le paiement au jeton

Le throughput provisionné réservé et le paiement au jeton sont complémentaires, et non exclusifs. Un endpoint de throughput provisionné réservé utilise automatiquement le paiement au jeton prioritaire pour tout trafic dépassant son pool réservé. Le tableau suivant montre où chaque option s'inscrit.

Compétence

Paiement par jeton

Throughput provisionné réservé

Base de tarification

Par jeton, selon l'utilisation

Capacité réservée, facturée pour la durée totale

Garantie de capacité

Pool partagé, au mieux

Pool dédié, réservé pour vous

Latence sous charge

Peut varier en fonction de la demande partagée

Cohérent pour la capacité réservée

Réservation

Aucun

1 ou 3 mois

Idéal pour

Trafic en dents de scie, interne ou exploratoire

Applications ou agents externes critiques pour l’entreprise en production

Compétence

Paiement par jeton

Throughput provisionné réservé

Base de tarification

Par jeton, selon l'utilisation

Capacité réservée, facturée pour la durée totale

Garantie de capacité

Pool partagé, au mieux

Pool dédié, réservé pour vous

Latence sous charge

Peut varier en fonction de la demande partagée

Cohérent pour la capacité réservée

Réservation

Aucun

1 ou 3 mois

Idéal pour

Trafic en dents de scie, interne ou exploratoire

Applications ou agents externes critiques pour l’entreprise en production

Fonctionnement des tarifs

Le throughput provisionné réservé est facturé sur la capacité que vous réservez, et non sur les requêtes que vous envoyez. Vous êtes facturé pour l’intégralité de la réservation sur toute sa durée, que vous utilisiez ou non la capacité réservée.

Que se passe-t-il

Comment cela est facturé

Trafic au sein de votre capacité réservée

Facturé en tant que capacité réservée pour la durée totale.

Dépassement de capacité au-delà de votre capacité réservée

Paiement par jeton prioritaire sur le dépassement uniquement.

Trafic après l’expiration d’une réservation

Paiement par jeton prioritaire. L’endpoint continue de servir, sans pool réservé.

Que se passe-t-il

Comment cela est facturé

Trafic au sein de votre capacité réservée

Facturé en tant que capacité réservée pour la durée totale.

Dépassement de capacité au-delà de votre capacité réservée

Paiement par jeton prioritaire sur le dépassement uniquement.

Trafic après l’expiration d’une réservation

Paiement par jeton prioritaire. L’endpoint continue de servir, sans pool réservé.

  • Une durée plus longue entraîne un tarif unitaire inférieur à une durée plus courte.
  • Lorsqu'un endpoint détient simultanément des réservations de durées différentes, chacune est tarifée indépendamment à son propre taux.
  • Les tarifs spécifiques dépendent du modèle et de la durée.

Avant de start

Exigence

Détail

Autorisation de modèle

Vous avez besoin de MANAGE sur le modèle de fondation dans Unity Catalog (le modèle enregistré system.ai.<model>). Si vous ne l’avez pas, demandez à un administrateur de vous l’accorder dans l’Explorateur de catalogues. Voir les autorisations Unity Catalog pour les modèles de fondation.

Un modèle éligible

Vous pouvez créer un throughput provisionné réservé uniquement sur les modèles éligibles. Consultez Modèles pris en charge.

Exigence

Détail

Autorisation de modèle

Vous avez besoin de MANAGE sur le modèle de fondation dans Unity Catalog (le modèle enregistré system.ai.<model>). Si vous ne l’avez pas, demandez à un administrateur de vous l’accorder dans l’Explorateur de catalogues. Voir les autorisations Unity Catalog pour les modèles de fondation.

Un modèle éligible

Vous pouvez créer un throughput provisionné réservé uniquement sur les modèles éligibles. Consultez Modèles pris en charge.

Créer un endpoint de throughput provisionné réservé

Vous créez un throughput provisionné réservé à partir de la page Serving .

  1. Accédez à la page Serving et commencez à créer un endpoint.
  2. Ajoutez une entité servie et sélectionnez un modèle de fondation éligible. Lorsque le modèle prend en charge le throughput provisionné réservé, l’option Throughput provisionné réservé s’affiche.
  3. Définissez vos unités de modèle . Utilisez l’estimateur d’unités de modèle pour dimensionner le pool : saisissez la forme de requête attendue — le nombre moyen de jetons d’entrée et de sortie par requête, le nombre de requêtes simultanées prévues et votre taux de réussite de cache attendu — et l’estimateur renverra les unités de modèle dont vous avez besoin.
  4. Choisissez une durée de réservation : 1 mois ou 3 mois.
  5. Créez l’endpoint. Databricks assure le provisionnement de la capacité dédiée.
remarque

Le type de capacité d'un endpoint est fixe lors de sa création. Vous ne pouvez pas convertir ultérieurement un endpoint existant en throughput provisionné réservé. Créez plutôt un nouvel endpoint de throughput provisionné réservé.

Afficher et superviser

La page de détails de l’endpoint affiche une section Configuration active intitulée Throughput provisionné réservé qui répertorie vos unités de modèle réservées ainsi que la durée, la date d’expiration et le statut de chaque réservation. Lorsqu’un endpoint contient plusieurs réservations empilées, issues de montées en charge ou de mises à niveau, elles apparaissent sous forme de liste.

L’onglet Metrics affiche la télémétrie de service habituelle, notamment les requêtes par minute, le nombre d’erreurs, la latence (p50, p90, p95 et p99), le nombre de jetons et le temps jusqu’au premier jeton (TTFT), afin que vous puissiez surveiller l’utilisation et décider quand monter en charge.

Monter en charge la capacité

Pour ajouter de la capacité, ouvrez Edit > Add capacity , saisissez le nombre d’unités de modèle à ajouter et choisissez une durée. Ceci crée une nouvelle réservation cumulée à celles existantes. Cela ne modifie ni n’interrompt ce que vous avez déjà. La page de détails liste ensuite chaque réservation, expirant selon son propre calendrier.

Expiration

  • À l’expiration, le pool réservé prend fin et l’endpoint continue de servir avec une priorité de paiement par jeton. Il s’agit d’un fallback, pas d’une interruption de service.
  • Pour conserver la capacité réservée après la fin d’une durée, créez une nouvelle réservation avant l’expiration de la réservation actuelle. Voir Monter en charge la capacité.
  • Les réservations expirées restent visibles avec un badge Expiré et sont conservées, non supprimées.

Comportement de dépassement de capacité

Le dépassement est activé automatiquement ; il n’y a rien à configurer. Lorsque le trafic dépasse votre capacité réservée, que ce soit en raison d’un pic ou de l’expiration d’une réservation, ces requêtes sont automatiquement traitées via le paiement au jeton prioritaire au lieu d’être rejetées avec une erreur de limitation de débit. Votre charge de travail continue de s’exécuter et vous ne payez qu’au jeton pour le dépassement. Les requêtes de dépassement sont limitées par les plafonds de débit du paiement au jeton.

Limitations

  • Vous pouvez créer un endpoint de throughput provisionné réservé par modèle et par Workspace dans la version actuelle.
  • Les réservations sont prépayées et courent sur toute leur durée. Vous ne pouvez pas annuler une réservation en cours de route.
  • Vous ne pouvez pas supprimer un endpoint disposant d'une réservation active tant que celle-ci n'est pas terminée.
  • Les utilisateurs sans MANAGE sur le modèle voient des vues en lecture seule.

Pour plus d'informations sur les limites des APIs de modèle de fondation, consultez Limites et quotas des APIs de modèle de fondation.

Ressources supplémentaires