Aller au contenu principal

Concepts de service

Cette page définit les concepts clés utilisés dans le cadre du serving en ligne sur Databricks, notamment les Endpoint de mise en service de modèles, les Endpoint de Feature Serving et les magasins de fonctionnalités en ligne.

Endpoint de serveur de modèle​

API REST qui expose un ou plusieurs modèles servis pour l’inférence. Les Endpoint de déploiement de modèles prennent en charge en option la recherche automatique de fonctionnalités à partir d’un Magasin de fonctionnalités en ligne.

Feature Serving endpoint​

API REST permettant de rechercher des valeurs de caractéristiques regroupées sous la forme d’un élément FeatureSpec, ce qui est utile pour transmettre des données de caractéristiques à un modèle exécuté en dehors de Databricks. Pour plus d’information, consultez la page Serve Feature Views.

Endpoint optimisé pour l'itinéraire​

Propriété de l'endpoint qui permet d'obtenir un meilleur chemin réseau avec une communication plus rapide et plus directe entre le client et l'endpoint lors de l'inférence, ce qui réduit la latence de surcharges et augmente le throughput. Disponible pour les Endpoint de service de modèle personnalisés et les Feature Serving. Pour plus d’informations, consultez Route optimization on serving Endpoint.

Simultanéité provisionnée​

Propriété d'Endpoint qui spécifie le nombre maximal de requêtes parallèles qu'un Endpoint peut gérer. Estimez la concurrence requise à l'aide de la formule : provisioned concurrency = queries per second (QPS) × model execution time (s).

Monter en charge jusqu'à zéro​

Propriété d'Endpoint qui réduit automatiquement la consommation de ressources à zéro lorsque l'Endpoint n'est pas utilisé. La mise à l'échelle à zéro est recommandée pour les tests et le développement. Cependant, la mise à l'échelle à zéro n'est pas recommandée pour les Endpoint de production, car la latence est plus élevée et la capacité n'est pas garantie lorsque l'échelle est réduite à zéro.

Entité servie​

Unité de déploiement nommée à l'intérieur d'un Endpoint qui représente un modèle spécifique avec sa configuration de compute qui peut recevoir le trafic routé.

Magasin de fonctionnalités en ligne​

Magasin de données qui fournit des valeurs de fonctionnalités aux applications en temps réel et aux Endpoint de serving avec une faible latence. Les magasins de fonctionnalités en ligne Databricks sont alimentés par Lakebase Autoscaling et synchronisent les données de fonctionnalités à partir de Feature Views ou de tables de fonctionnalités. Pour plus d'informations, consultez Databricks Online Magasins de fonctionnalités.

Configuration du trafic​

Spécification du pourcentage de trafic vers un Endpoint qui devrait aller à chaque modèle. La configuration du trafic est requise pour les endpoints comportant plusieurs modèles servis.

Voici un exemple où l'Endpoint nommé multi-pt-model héberge la version 2 de meta_llama_v3_1_70b_instruct qui reçoit 60 % du trafic de l'Endpoint, et héberge également la version 3 de meta_llama_v3_1_8b_instruct qui reçoit 40 % du trafic de l'Endpoint. Pour plus d'informations, consultez Déployer plusieurs modèles vers un Endpoint de service de modèle.

Bash

POST /api/2.0/serving-endpoints
{
"name":"multi-pt-model"
"config":
{
"served_entities":
[
{
"name":"meta_llama_v3_1_70b_instruct",
"entity_name":"system.ai.meta_llama_v3_1_70b_instruct",
"entity_version":"4",
"min_provisioned_throughput":0,
"max_provisioned_throughput":2400
},
{
"name":"meta_llama_v3_1_8b_instruct",
"entity_name":"system.ai.meta_llama_v3_1_8b_instruct",
"entity_version":"4",
"min_provisioned_throughput":0,
"max_provisioned_throughput":1240
}
],
"traffic_config":
{
"routes":
[
{
"served_model_name":"meta_llama_v3_1_8b_instruct",
"traffic_percentage":"60"
},
{
"served_model_name":"meta_llama_v3_1_70b_instruct",
"traffic_percentage":"40"
}
]
}
}
}