Aller au contenu principal

Limites et régions de Model Serving

Le présent article résume les limitations et la disponibilité régionale pour Databricks Model Serving et les types d'endpoints pris en charge.

Limites des ressources et de la charge utile

Model Serving impose des limites default pour garantir des performances fiables. Si vous avez des commentaires sur ces limites, contactez votre équipe de compte Databricks.

Les limites de cette section s’appliquent uniquement aux points de terminaison de modèles personnalisés et d’ agents. Pour les APIs de modèle de fondation et les limites de ressources et de charge utile des modèles externes, consultez les limites de débit et les quotas des APIs de modèle de fondation.

Modèles et agents personnalisés

Fonctionnalité

Granularité

Limite

Points de terminaison

Per Workspace

1 000. Contactez votre équipe de compte Databricks pour augmenter.

Requêtes par seconde (QPS)

Par endpoint

300 000 utilisant l'optimisation des itinéraires. Si une concurrence de 1 024 n'est pas suffisante, contactez votre équipe de compte Databricks pour l'augmenter.

Requêtes par seconde (QPS)

Per Workspace

300 000 utilisant l'optimisation des itinéraires. 200 pour les itinéraires non optimisés, recommandé uniquement pour les petits cas d'utilisation de développement.

Simultanéité provisionnée

Par modèle

1024 avec option personnalisée et optimisation d'itinéraire. Contactez votre équipe de compte Databricks pour augmenter la limite.

Simultanéité provisionnée

Per Workspace

4096. Contactez votre équipe de compte Databricks pour augmenter.

Opérations de création/mise à jour

Per Workspace

50 en 5 minutes.

Taille de la charge utile

Par requête

16 Mo. Pour les agent Endpoint, la limite est de 4 Mo.

Durée d'exécution du modèle

Par requête

597 secondes

Utilisation de la mémoire du modèle à l'endpoint CPU

Par instance de modèle

Dépend du type de charge de travail du CPU : CPU (4 Go), CPU_MEDIUM (8 Go), CPU_LARGE (16 Go). Voir Modèles personnalisés.

Variables d'environnement

Par modèle servi

50. Contactez votre équipe de compte Databricks pour augmenter.

Latence du système

Par requête

Moins de 20 millisecondes avec l’ optimisation d’itinéraire.

Fonctionnalité

Granularité

Limite

Points de terminaison

Per Workspace

1 000. Contactez votre équipe de compte Databricks pour augmenter.

Requêtes par seconde (QPS)

Par endpoint

300 000 utilisant l'optimisation des itinéraires. Si une concurrence de 1 024 n'est pas suffisante, contactez votre équipe de compte Databricks pour l'augmenter.

Requêtes par seconde (QPS)

Per Workspace

300 000 utilisant l'optimisation des itinéraires. 200 pour les itinéraires non optimisés, recommandé uniquement pour les petits cas d'utilisation de développement.

Simultanéité provisionnée

Par modèle

1024 avec option personnalisée et optimisation d'itinéraire. Contactez votre équipe de compte Databricks pour augmenter la limite.

Simultanéité provisionnée

Per Workspace

4096. Contactez votre équipe de compte Databricks pour augmenter.

Opérations de création/mise à jour

Per Workspace

50 en 5 minutes.

Taille de la charge utile

Par requête

16 Mo. Pour les agent Endpoint, la limite est de 4 Mo.

Durée d'exécution du modèle

Par requête

597 secondes

Utilisation de la mémoire du modèle à l'endpoint CPU

Par instance de modèle

Dépend du type de charge de travail du CPU : CPU (4 Go), CPU_MEDIUM (8 Go), CPU_LARGE (16 Go). Voir Modèles personnalisés.

Variables d'environnement

Par modèle servi

50. Contactez votre équipe de compte Databricks pour augmenter.

Latence du système

Par requête

Moins de 20 millisecondes avec l’ optimisation d’itinéraire.

Limitations de la mise en réseau et de la sécurité

  • Les Endpoints Model Serving sont protégés par le contrôle d'accès et respectent les règles d'entrée liées au réseau configurées sur le Workspace.
  • Model Serving ne fournit pas de correctifs de sécurité aux images de modèle existantes en raison du risque de déstabilisation des déploiements de production. Une nouvelle image de modèle créée à partir d'une nouvelle version de modèle contiendra les derniers correctifs. Contactez votre équipe de compte Databricks pour plus d'informations.

Limites des APIs du modèle de fondation

Pour des informations détaillées sur les APIs des modèles de fondation, y compris les limites de ressources et de charge utile pour les modèles de fondation et externes, veuillez consulter les limites de taux et les quotas des APIs des modèles de fondation.

Disponibilité régionale

remarque

Si vous avez besoin d'un Endpoint dans une région non prise en charge, contactez votre équipe de compte Databricks.

Si votre Workspace est déployé dans une région qui prend en charge le service de modèle, mais qu'il est desservi par un plan de contrôle dans une région non prise en charge, le Workspace ne prend pas en charge le service de modèle. Si vous tentez d'utiliser le service de modèle dans un tel Workspace, un message d'erreur s'affichera, indiquant que votre Workspace n'est pas pris en charge. Contactez votre équipe de compte Databricks pour plus d'informations.

Pour plus d'informations sur la disponibilité régionale des fonctionnalités, consultez la page Disponibilité des fonctionnalités de service de modèle.

Pour connaître la disponibilité régionale des modèles de fondation hébergés par Databricks, consultez Les modèles de fondation hébergés sur Databricks.