Concepts de Model Serving
Cette page fournit des définitions des concepts clés utilisés dans Model Serving pour les déploiements de modèles.
Endpoint
API REST qui expose un ou plusieurs modèles déployés pour l'inférence.
Endpoint optimisé pour l'itinéraire
Propriété d'endpoint qui permet un chemin réseau amélioré avec une communication plus rapide et plus directe entre l'utilisateur et le modèle pendant l'inférence. Pour plus d'informations, consultez Optimisation de l'itinéraire sur les Endpoint desservis.
Simultanéité provisionnée
Propriété d'Endpoint qui spécifie le nombre maximal de requêtes parallèles qu'un Endpoint peut gérer. Estimez la concurrence requise à l'aide de la formule : provisioned concurrency = queries per second (QPS) × model execution time (s).
Monter en charge jusqu'à zéro
Propriété d'Endpoint qui réduit automatiquement la consommation de ressources à zéro lorsque l'Endpoint n'est pas utilisé. La mise à l'échelle à zéro est recommandée pour les tests et le développement. Cependant, la mise à l'échelle à zéro n'est pas recommandée pour les Endpoint de production, car la latence est plus élevée et la capacité n'est pas garantie lorsque l'échelle est réduite à zéro.
Entité servie
Unité de déploiement nommée à l'intérieur d'un Endpoint qui représente un modèle spécifique avec sa configuration de compute qui peut recevoir le trafic routé.
Configuration du trafic
Spécification du pourcentage de trafic vers un Endpoint qui devrait aller à chaque modèle. La configuration du trafic est requise pour les endpoints comportant plusieurs modèles servis.
Voici un exemple où l'Endpoint nommé multi-pt-model héberge la version 2 de meta_llama_v3_1_70b_instruct qui reçoit 60 % du trafic de l'Endpoint, et héberge également la version 3 de meta_llama_v3_1_8b_instruct qui reçoit 40 % du trafic de l'Endpoint. Pour plus d'informations, consultez Déployer plusieurs modèles vers un Endpoint de service de modèle.
POST /api/2.0/serving-endpoints
{
"name":"multi-pt-model"
"config":
{
"served_entities":
[
{
"name":"meta_llama_v3_1_70b_instruct",
"entity_name":"system.ai.meta_llama_v3_1_70b_instruct",
"entity_version":"4",
"min_provisioned_throughput":0,
"max_provisioned_throughput":2400
},
{
"name":"meta_llama_v3_1_8b_instruct",
"entity_name":"system.ai.meta_llama_v3_1_8b_instruct",
"entity_version":"4",
"min_provisioned_throughput":0,
"max_provisioned_throughput":1240
}
],
"traffic_config":
{
"routes":
[
{
"served_model_name":"meta_llama_v3_1_8b_instruct",
"traffic_percentage":"60"
},
{
"served_model_name":"meta_llama_v3_1_70b_instruct",
"traffic_percentage":"40"
}
]
}
}
}