Paiement au jeton prioritaire pour les APIs Foundation Model
Cette page décrit le paiement au jeton prioritaire pour les APIs Foundation Model à paiement au jeton, y compris son fonctionnement et la manière d'envoyer des demandes de priorité.
Qu'est-ce que le paiement par jeton prioritaire ?
Le paiement par jeton prioritaire, également appelé mode priorité, est une capacité de paiement par jeton pour les applications sensibles à la latence et en temps réel. Lorsque vous envoyez une requête avec le paramètre service_tier défini sur "priority", Databricks admet la requête avant le trafic standard de paiement par jeton au meilleur effort sur le même modèle. Cela maintient une disponibilité plus cohérente pendant les périodes de fort trafic.
Le paiement prioritaire par jeton est activable par requête, vous pouvez donc envoyer des requêtes prioritaires et standard au même modèle. Cela ne nécessite aucun engagement de capacité et est facturé à un tarif par jeton plus élevé que les requêtes de paiement par jeton standard.
Databricks recommande le mode priorité lorsque :
- Vous avez besoin de performances et une disponibilité plus cohérentes que le paiement au jeton standard, mais n'êtes pas prêt à vous commit sur une capacité dédiée.
- Vos applications de production nécessitent une disponibilité accrue.
Modèles pris en charge
Les modèles de paiement par jeton suivants prennent en charge le mode priorité. Pour envoyer une requête prioritaire, utilisez le nom de l'endpoint du modèle avec le paramètre service_tier défini sur "priority".
Fournisseur | Modèle | Nom de l’Endpoint | Notes |
|---|---|---|---|
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
OpenAI |
| ||
| Disponible sur l'endpoint global uniquement. Nécessite un routage inter-géographique. | ||
| Disponible sur l'endpoint global uniquement. Nécessite un routage inter-géographique. | ||
| Disponible sur l'endpoint global uniquement. Nécessite un routage inter-géographique. | ||
| Disponible sur l'endpoint global uniquement. Nécessite un routage inter-géographique. |
Comportement du paiement prioritaire par jeton
Veuillez prendre en compte le comportement suivant avant d'utiliser le paiement au jeton prioritaire :
- Performances et disponibilité constantes Le paiement prioritaire au jeton est conçu pour maintenir une disponibilité constante en cas de charge. Il ne garantit pas un délai jusqu'au premier jeton ou un objectif de latence de bout en bout spécifique. Les requêtes prioritaires visent une disponibilité plus élevée que les requêtes de paiement au jeton standard. Databricks définit la disponibilité à un niveau comme le nombre de requêtes réussies divisé par le nombre total de requêtes admises à ce niveau.
- Capacité best-effort. Le mode prioritaire ne réserve pas de capacité et il n'y a pas d'engagement de capacité. Pour une capacité garantie, utilisez un throughput provisionné.
- Fallback au paiement par jeton standard . Si la capacité prioritaire est entièrement souscrite, les requêtes sont traitées selon la disponibilité standard du paiement par jeton et facturées aux tarifs standard du paiement par jeton.
- Prime par jeton . Les requêtes prioritaires sont facturées à un tarif par jeton plus élevé que les requêtes de paiement par jeton standard.
Paiement prioritaire au jeton par rapport au throughput provisionné
Le paiement par jeton prioritaire et le throughput provisionné ciblent tous deux les charges de travail de production, mais ils présentent des compromis différents :
Considération | Paiement par jeton prioritaire | Throughput provisionné |
|---|---|---|
Capacité | Best-effort, partagé. | Capacité dédiée, réservée. |
Engagement | Aucun. Activez par requête. | Nécessite un endpoint provisionné. |
Disponibilité | Plus cohérent que le paiement au jeton standard sous charge. | Prévisible, basé sur la capacité réservée. |
Facturation | Par jeton, à un coût supérieur au paiement au jeton standard. | Basé sur les unités de modèle provisionnées. |
Envoyer une demande de priorité
Pour utiliser le mode priorité, définissez le paramètre service_tier sur "priority" par requête. L'exemple suivant utilise le client OpenAI :
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
Consultez la référence de l'API REST de modèle de fondation pour la syntaxe des paramètres et Utiliser les modèles de fondation pour plus d'options de requête.
Limites de capacité
Chaque cluster prend en charge un nombre total maximal de jetons par minute pour tous les tenants. Databricks définit une limite par tenant lors de l'intégration afin qu'un seul tenant ne puisse pas consommer toute la capacité du cluster. Si votre charge de travail nécessite plus de capacité que la limite par tenant ne l'autorise, demandez un throughput provisionné.
Pour plus d'informations sur les limites des APIs de modèle de fondation, consultez Limites et quotas des APIs de modèle de fondation.