Unités de modèle dans le throughput provisionné
Les unités de modèle sont une unité de throughput qui détermine la quantité de travail que votre Endpoint peut gérer par minute. Lorsque vous créez un nouvel endpoint de throughput provisionné, vous spécifiez le nombre d’unités de modèle à provisionner pour chaque modèle servi.
La quantité de travail requise pour traiter chaque requête à votre Endpoint dépend de la taille de l’entrée et de la sortie générée. Au fur et à mesure que le nombre de jetons d’entrée et de sortie augmente, la quantité de travail requise pour traiter une requête augmente également. La génération de jetons de sortie n’cessite davantage de ressources que le traitement des jetons d’entrée. Le travail requis pour chaque requête augmente de manière non linéaire à mesure que le nombre de jetons d’entrée ou de sortie augmente, ce qui signifie que pour une quantité donnée d’unités de modèle, votre Endpoint peut gérer au choix :
- Plusieurs petites requêtes à la fois.
- Moins de requêtes à contexte long à la fois avant qu'il ne manque de capacité.
Par exemple, avec une charge de travail de taille moyenne comprenant 3 500 jetons d'entrée et 300 jetons de sortie, vous pouvez estimer le throughput de jetons par seconde pour un nombre donné d'unités de modèle :
Modèle | Unités de modèle | Jetons estimés par seconde |
|---|---|---|
Llama 4 Maverick | 50 | 3250 |
Modèles qui utilisent les unités de modèle
Tous les modèles de fondation pris en charge pour le throughput provisionné provisionnent la capacité d’inférence à l’aide d’ unités de modèle , à l’exception des modèles hérités énumérés ci-dessous.
Les endpoints de déploiement de modèles qui servent des modèles des familles de modèles héritées suivantes provisionnent une capacité d'inférence basée sur des plages de jetons par seconde configurées lors de la création de l'endpoint:
- Meta Llama 3.3
- Meta Llama 3.2 3B
- Meta Llama 3.2 1B
- Meta Llama 3.1
- GTE v1.5 (Anglais)
- BGE v1.5 (Anglais)
- DeepSeek R1 (non disponible dans Unity Catalog)
- Meta Llama 3
- Meta Llama 2
- DBRX
- Mistral
- Mixtral
- MPT