Limites et régions de Model Serving
Le présent article résume les limitations et la disponibilité régionale pour Databricks Model Serving et les types d'endpoints pris en charge.
Limites des ressources et de la charge utile
Model Serving impose des limites default pour garantir des performances fiables. Si vous avez des commentaires sur ces limites, contactez votre équipe de compte Databricks.
Les limites de cette section s’appliquent uniquement aux points de terminaison de modèles personnalisés et d’ agents. Pour les APIs de modèle de fondation et les limites de ressources et de charge utile des modèles externes, consultez les limites de débit et les quotas des APIs de modèle de fondation.
Modèles et agents personnalisés
Fonctionnalité | Granularité | Limite |
|---|---|---|
Points de terminaison | Per Workspace | 1 000. Contactez votre équipe de compte Databricks pour augmenter. |
Requêtes par seconde (QPS) | Par endpoint | 300 000 utilisant l'optimisation des itinéraires. Si une concurrence de 1 024 n'est pas suffisante, contactez votre équipe de compte Databricks pour l'augmenter. |
Requêtes par seconde (QPS) | Per Workspace | 300 000 utilisant l'optimisation des itinéraires. 200 pour les itinéraires non optimisés, recommandé uniquement pour les petits cas d'utilisation de développement. |
Simultanéité provisionnée | Par modèle | 1024 avec option personnalisée et optimisation d'itinéraire. Contactez votre équipe de compte Databricks pour augmenter la limite. |
Simultanéité provisionnée | Per Workspace | 4096. Contactez votre équipe de compte Databricks pour augmenter. |
Opérations de création/mise à jour | Per Workspace | 50 en 5 minutes. |
Taille de la charge utile | Par requête | 16 Mo. Pour les agent Endpoint, la limite est de 4 Mo. |
Taille de la requête/réponse | Par requête | Toute requête/réponse de plus de 1 Mo ne sera pas consignée. |
Durée d'exécution du modèle | Par requête | 597 secondes |
Utilisation de la mémoire du modèle à l'endpoint CPU | Par instance de modèle | Dépend du type de charge de travail du CPU : |
Utilisation de la mémoire du modèle d'endpoint GPU | Par endpoint | Dépend du type de GPU |
Variables d'environnement | Par modèle servi | 50. Contactez votre équipe de compte Databricks pour augmenter. |
Latence du système | Par requête | Moins de 20 millisecondes avec l’ optimisation d’itinéraire. |
Limitations de la mise en réseau et de la sécurité
- Les endpoints Model Serving sont protégés par le contrôle d'accès et respectent les règles d'entrée liées au réseau configurées sur le workspace, telles que les listes blanches d'adresses IP et PrivateLink.
- Par default, Model Serving ne prend pas en charge PrivateLink vers les Endpoints externes. La prise en charge de cette fonctionnalité est évaluée et mise en œuvre par région. Contactez votre équipe de compte Databricks pour plus d'informations.
- Model Serving ne fournit pas de correctifs de sécurité aux images de modèle existantes en raison du risque de déstabilisation des déploiements de production. Une nouvelle image de modèle créée à partir d'une nouvelle version de modèle contiendra les derniers correctifs. Contactez votre équipe de compte Databricks pour plus d'informations.
- Vous pouvez restreindre l'accès réseau sortant à partir des endpoints Model Serving en configurant des stratégies réseau. Consultez Gérer les stratégies réseau pour le contrôle de sortie Serverless.
Normes du profil de sécurité de la conformité
Consultez Disponibilité des normes de conformité avec le compute serverless et standard pour connaître la disponibilité régionale de ces normes.
Limites des APIs du modèle de fondation
Pour des informations détaillées sur les APIs des modèles de fondation, y compris les limites de ressources et de charge utile pour les modèles de fondation et externes, veuillez consulter les limites de taux et les quotas des APIs des modèles de fondation.
Disponibilité régionale
Si vous avez besoin d'un Endpoint dans une région non prise en charge, contactez votre équipe de compte Databricks.
Si votre Workspace est déployé dans une région qui prend en charge le service de modèle, mais qu'il est desservi par un plan de contrôle dans une région non prise en charge, le Workspace ne prend pas en charge le service de modèle. Si vous tentez d'utiliser le service de modèle dans un tel Workspace, un message d'erreur s'affichera, indiquant que votre Workspace n'est pas pris en charge. Contactez votre équipe de compte Databricks pour plus d'informations.
Consultez la disponibilité des fonctionnalités Model Serving pour plus d’informations sur la disponibilité régionale de chaque fonctionnalité Model Serving.
Pour connaître la disponibilité régionale des modèles de fondation hébergés par Databricks, consultez Modèles de fondation hébergés sur Databricks.