Aller au contenu principal

Limites et régions de Model Serving

Le présent article résume les limitations et la disponibilité régionale pour Databricks Model Serving et les types d'endpoints pris en charge.

Limites des ressources et de la charge utile

Model Serving impose des limites default pour garantir des performances fiables. Si vous avez des commentaires sur ces limites, contactez votre équipe de compte Databricks.

Les limites de cette section s'appliquent uniquement aux modèles personnalisés et aux Endpoint d'agent IA. Pour les APIs des modèles de fondation et les limites de ressources et de charge utile des modèles externes, consultez les limites de débit et les quotas des APIs des modèles de fondation.

Modèles personnalisés et agents d'IA.

Fonctionnalité

Granularité

Limite

Points de terminaison

Per Workspace

1 000. Contactez votre équipe de compte Databricks pour augmenter.

Requêtes par seconde (QPS)

Par endpoint

300 000 utilisant l'optimisation des itinéraires. Si une concurrence de 1 024 n'est pas suffisante, contactez votre équipe de compte Databricks pour l'augmenter.

Requêtes par seconde (QPS)

Per Workspace

300 000 utilisant l'optimisation des itinéraires. 200 pour les itinéraires non optimisés, recommandé uniquement pour les petits cas d'utilisation de développement.

Simultanéité provisionnée

Par modèle

1024 avec option personnalisée et optimisation d'itinéraire. Contactez votre équipe de compte Databricks pour augmenter la limite.

Simultanéité provisionnée

Per Workspace

4096. Contactez votre équipe de compte Databricks pour augmenter.

Opérations de création/mise à jour

Per Workspace

50 en 5 minutes.

Taille de la charge utile

Par requête

16 Mo. Pour les AI agent Endpoint, la limite est de 4 Mo.

Taille de la requête/réponse

Par requête

Toute requête/réponse de plus de 1 Mo ne sera pas consignée.

Durée d'exécution du modèle

Par requête

597 secondes

Utilisation de la mémoire du modèle à l'endpoint CPU

Par instance de modèle

Dépend du type de charge de travail du CPU : CPU (4 Go), CPU_MEDIUM (8 Go), CPU_LARGE (16 Go). Voir Modèles personnalisés.

Utilisation de la mémoire du modèle d'endpoint GPU

Par endpoint

Dépend du type de GPU

Variables d'environnement

Par modèle servi

50. Contactez votre équipe de compte Databricks pour augmenter.

Latence du système

Par requête

Moins de 20 millisecondes avec l’ optimisation d’itinéraire.

Fonctionnalité

Granularité

Limite

Points de terminaison

Per Workspace

1 000. Contactez votre équipe de compte Databricks pour augmenter.

Requêtes par seconde (QPS)

Par endpoint

300 000 utilisant l'optimisation des itinéraires. Si une concurrence de 1 024 n'est pas suffisante, contactez votre équipe de compte Databricks pour l'augmenter.

Requêtes par seconde (QPS)

Per Workspace

300 000 utilisant l'optimisation des itinéraires. 200 pour les itinéraires non optimisés, recommandé uniquement pour les petits cas d'utilisation de développement.

Simultanéité provisionnée

Par modèle

1024 avec option personnalisée et optimisation d'itinéraire. Contactez votre équipe de compte Databricks pour augmenter la limite.

Simultanéité provisionnée

Per Workspace

4096. Contactez votre équipe de compte Databricks pour augmenter.

Opérations de création/mise à jour

Per Workspace

50 en 5 minutes.

Taille de la charge utile

Par requête

16 Mo. Pour les AI agent Endpoint, la limite est de 4 Mo.

Taille de la requête/réponse

Par requête

Toute requête/réponse de plus de 1 Mo ne sera pas consignée.

Durée d'exécution du modèle

Par requête

597 secondes

Utilisation de la mémoire du modèle à l'endpoint CPU

Par instance de modèle

Dépend du type de charge de travail du CPU : CPU (4 Go), CPU_MEDIUM (8 Go), CPU_LARGE (16 Go). Voir Modèles personnalisés.

Utilisation de la mémoire du modèle d'endpoint GPU

Par endpoint

Dépend du type de GPU

Variables d'environnement

Par modèle servi

50. Contactez votre équipe de compte Databricks pour augmenter.

Latence du système

Par requête

Moins de 20 millisecondes avec l’ optimisation d’itinéraire.

Limitations de la mise en réseau et de la sécurité

  • Les endpoints Model Serving sont protégés par le contrôle d'accès et respectent les règles d'entrée liées au réseau configurées sur le workspace, telles que les listes blanches d'adresses IP et PrivateLink.
  • Par default, Model Serving ne prend pas en charge PrivateLink vers les Endpoints externes. La prise en charge de cette fonctionnalité est évaluée et mise en œuvre par région. Contactez votre équipe de compte Databricks pour plus d'informations.
  • Model Serving ne fournit pas de correctifs de sécurité aux images de modèle existantes en raison du risque de déstabilisation des déploiements de production. Une nouvelle image de modèle créée à partir d'une nouvelle version de modèle contiendra les derniers correctifs. Contactez votre équipe de compte Databricks pour plus d'informations.
  • Vous pouvez restreindre l'accès réseau sortant à partir des endpoints Model Serving en configurant des stratégies réseau. Consultez Gérer les stratégies réseau pour le contrôle de sortie Serverless.

Normes du profil de sécurité de conformité : Charges de travail CPU et GPU

Le tableau suivant répertorie la disponibilité régionale et les normes de conformité prises en charge pour le profil de sécurité de la conformité concernant la mise en service de modèles sur des charges de travail CPU et GPU, y compris les modèles externes.

remarque

Ces normes de conformité exigent que les conteneurs servis soient construits au cours des 30 derniers jours. Databricks reconstitue automatiquement les conteneurs obsolètes en votre nom. Cependant, si ce Job automatisé échoue, un message de Logs d'événements similaire à ce qui suit apparaît et fournit des conseils sur la manière de garantir que vos Endpoints restent conformes aux exigences de conformité :

"Databricks couldn't complete a scheduled compliance check for model $servedModelName. This can happen if the system can't apply a required update. To resolve, try relogging your model. If the issue persists, contact support@databricks.com."

Région

Emplacement

HIPAA

PCI-DSS

FedRAMP Moderate

IRAP

CCCS Medium (Protégé B)

UK Cyber Essentials Plus

ap-northeast-1

Asie-Pacifique (Tokyo)

ap-northeast-2

Asie-Pacifique (Séoul)

ap-south-1

Asie-Pacifique (Mumbai)

ap-southeast-1

Asie-Pacifique (Singapour)

ap-southeast-2

Asie-Pacifique (Sydney)

ca-central-1

Canada (Centre)

eu-central-1

UE (Francfort)

eu-west-1

UE (Irlande)

eu-west-2

UE (Londres)

eu-west-3

UE (Paris)

sa-east-1

Amérique du Sud (Sao Paulo)

us-east-1

États-Unis – Est (Virginie du Nord)

us-east-2

États-Unis – Est (Ohio)

us-gov-west-1

États-Unis – Gouv, Ouest (Pendleton)

us-west-1

États-Unis – Ouest (Oregon)

us-west-2

États-Unis – Ouest (Oregon)

Région

Emplacement

HIPAA

PCI-DSS

FedRAMP Moderate

IRAP

CCCS Medium (Protégé B)

UK Cyber Essentials Plus

ap-northeast-1

Asie-Pacifique (Tokyo)

ap-northeast-2

Asie-Pacifique (Séoul)

ap-south-1

Asie-Pacifique (Mumbai)

ap-southeast-1

Asie-Pacifique (Singapour)

ap-southeast-2

Asie-Pacifique (Sydney)

ca-central-1

Canada (Centre)

eu-central-1

UE (Francfort)

eu-west-1

UE (Irlande)

eu-west-2

UE (Londres)

eu-west-3

UE (Paris)

sa-east-1

Amérique du Sud (Sao Paulo)

us-east-1

États-Unis – Est (Virginie du Nord)

us-east-2

États-Unis – Est (Ohio)

us-gov-west-1

États-Unis – Gouv, Ouest (Pendleton)

us-west-1

États-Unis – Ouest (Oregon)

us-west-2

États-Unis – Ouest (Oregon)

Normes du profil de sécurité de la conformité : Charges de travail des APIs Foundation Model

Le tableau répertorie les normes de conformité du profil de sécurité de conformité prises en charge pour les charges de travail suivantes des APIs de modèles de fondation :

  • Throughput provisionné
  • Paiement par jeton
  • Inférence par Batch à l'aide des AI Functions et des modèles hébergés par Databricks
remarque

Ces normes de conformité exigent que les conteneurs servis soient construits au cours des 30 derniers jours. Databricks reconstitue automatiquement les conteneurs obsolètes en votre nom. Cependant, si ce Job automatisé échoue, un message de Logs d'événements similaire à ce qui suit apparaît et fournit des conseils sur la manière de garantir que vos Endpoints restent conformes aux exigences de conformité :

"Databricks couldn't complete a scheduled compliance check for model $servedModelName. This can happen if the system can't apply a required update. To resolve, try relogging your model. If the issue persists, contact support@databricks.com."

Région

Emplacement

HIPAA

PCI-DSS

FedRAMP Moderate

IRAP

CCCS Medium (Protégé B)

UK Cyber Essentials Plus

ap-northeast-1

Asie-Pacifique (Tokyo)

ap-northeast-2

Asie-Pacifique (Séoul)

ap-south-1

Asie-Pacifique (Mumbai)

ap-southeast-1

Asie-Pacifique (Singapour)

ap-southeast-2

Asie-Pacifique (Sydney)

ca-central-1

Canada (Centre)

eu-central-1

UE (Francfort)

eu-west-1

UE (Irlande)

eu-west-2

UE (Londres)

✓*

eu-west-3

UE (Paris)

sa-east-1

Amérique du Sud (Sao Paulo)

us-east-1

États-Unis – Est (Virginie du Nord)

us-east-2

États-Unis – Est (Ohio)

us-gov-west-1

États-Unis – Gouv, Ouest (Pendleton)

us-west-1

États-Unis – Ouest (Oregon)

us-west-2

États-Unis – Ouest (Oregon)

Région

Emplacement

HIPAA

PCI-DSS

FedRAMP Moderate

IRAP

CCCS Medium (Protégé B)

UK Cyber Essentials Plus

ap-northeast-1

Asie-Pacifique (Tokyo)

ap-northeast-2

Asie-Pacifique (Séoul)

ap-south-1

Asie-Pacifique (Mumbai)

ap-southeast-1

Asie-Pacifique (Singapour)

ap-southeast-2

Asie-Pacifique (Sydney)

ca-central-1

Canada (Centre)

eu-central-1

UE (Francfort)

eu-west-1

UE (Irlande)

eu-west-2

UE (Londres)

✓*

eu-west-3

UE (Paris)

sa-east-1

Amérique du Sud (Sao Paulo)

us-east-1

États-Unis – Est (Virginie du Nord)

us-east-2

États-Unis – Est (Ohio)

us-gov-west-1

États-Unis – Gouv, Ouest (Pendleton)

us-west-1

États-Unis – Ouest (Oregon)

us-west-2

États-Unis – Ouest (Oregon)

* Certains modèles nécessitent un routage inter-géographique pour le throughput provisionné et ne sont donc pas conformes à UK Cyber Essentials Plus. Contactez l'équipe de votre compte Databricks pour plus d'informations.

Limites des APIs du modèle de fondation

Pour des informations détaillées sur les APIs des modèles de fondation, y compris les limites de ressources et de charge utile pour les modèles de fondation et externes, veuillez consulter les limites de taux et les quotas des APIs des modèles de fondation.

Disponibilité régionale

remarque

Si vous avez besoin d'un Endpoint dans une région non prise en charge, contactez votre équipe de compte Databricks.

Si votre Workspace est déployé dans une région qui prend en charge le service de modèle, mais qu'il est desservi par un plan de contrôle dans une région non prise en charge, le Workspace ne prend pas en charge le service de modèle. Si vous tentez d'utiliser le service de modèle dans un tel Workspace, un message d'erreur s'affichera, indiquant que votre Workspace n'est pas pris en charge. Contactez votre équipe de compte Databricks pour plus d'informations.

Consultez la disponibilité des fonctionnalités Model Serving pour plus d’informations sur la disponibilité régionale de chaque fonctionnalité Model Serving.

Pour connaître la disponibilité régionale des modèles de fondation hébergés par Databricks, consultez Modèles de fondation hébergés sur Databricks.