Limites et régions de Model Serving
Le présent article résume les limitations et la disponibilité régionale pour Databricks Model Serving et les types d'endpoints pris en charge.
Limites des ressources et de la charge utile
Model Serving impose des limites default pour garantir des performances fiables. Si vous avez des commentaires sur ces limites, contactez votre équipe de compte Databricks.
Les limites de cette section s’appliquent uniquement aux points de terminaison de modèles personnalisés et d’ agents. Pour les APIs de modèle de fondation et les limites de ressources et de charge utile des modèles externes, consultez les limites de débit et les quotas des APIs de modèle de fondation.
Modèles et agents personnalisés
Fonctionnalité | Granularité | Limite |
|---|---|---|
Points de terminaison | Per Workspace | 1 000. Contactez votre équipe de compte Databricks pour augmenter. |
Requêtes par seconde (QPS) | Par endpoint | 300 000 utilisant l'optimisation des itinéraires. Si une concurrence de 1 024 n'est pas suffisante, contactez votre équipe de compte Databricks pour l'augmenter. |
Requêtes par seconde (QPS) | Per Workspace | 300 000 utilisant l'optimisation des itinéraires. 200 pour les itinéraires non optimisés, recommandé uniquement pour les petits cas d'utilisation de développement. |
Simultanéité provisionnée | Par modèle | 1024 avec option personnalisée et optimisation d'itinéraire. Contactez votre équipe de compte Databricks pour augmenter la limite. |
Simultanéité provisionnée | Per Workspace | 4096. Contactez votre équipe de compte Databricks pour augmenter. |
Opérations de création/mise à jour | Per Workspace | 50 en 5 minutes. |
Taille de la charge utile | Par requête | 16 Mo. Pour les agent Endpoint, la limite est de 4 Mo. |
Durée d'exécution du modèle | Par requête | 597 secondes |
Utilisation de la mémoire du modèle à l'endpoint CPU | Par instance de modèle | Dépend du type de charge de travail du CPU : |
Variables d'environnement | Par modèle servi | 50. Contactez votre équipe de compte Databricks pour augmenter. |
Latence du système | Par requête | Moins de 20 millisecondes avec l’ optimisation d’itinéraire. |
Limitations de la mise en réseau et de la sécurité
- Les Endpoints Model Serving sont protégés par le contrôle d'accès et respectent les règles d'entrée liées au réseau configurées sur le Workspace.
- Model Serving ne fournit pas de correctifs de sécurité aux images de modèle existantes en raison du risque de déstabilisation des déploiements de production. Une nouvelle image de modèle créée à partir d'une nouvelle version de modèle contiendra les derniers correctifs. Contactez votre équipe de compte Databricks pour plus d'informations.
Limites des APIs du modèle de fondation
Pour des informations détaillées sur les APIs des modèles de fondation, y compris les limites de ressources et de charge utile pour les modèles de fondation et externes, veuillez consulter les limites de taux et les quotas des APIs des modèles de fondation.
Disponibilité régionale
Si vous avez besoin d'un Endpoint dans une région non prise en charge, contactez votre équipe de compte Databricks.
Si votre Workspace est déployé dans une région qui prend en charge le service de modèle, mais qu'il est desservi par un plan de contrôle dans une région non prise en charge, le Workspace ne prend pas en charge le service de modèle. Si vous tentez d'utiliser le service de modèle dans un tel Workspace, un message d'erreur s'affichera, indiquant que votre Workspace n'est pas pris en charge. Contactez votre équipe de compte Databricks pour plus d'informations.
Pour plus d'informations sur la disponibilité régionale des fonctionnalités, consultez la page Disponibilité des fonctionnalités de service de modèle.
Pour connaître la disponibilité régionale des modèles de fondation hébergés par Databricks, consultez Les modèles de fondation hébergés sur Databricks.