Configurer les limites de débit pour les services d'IA à l'aide de Unity AI Gateway
Bêta
Cette fonctionnalité est en Bêta. Les administrateurs de compte peuvent contrôler l'accès à cette fonctionnalité depuis la page Aperçus de la console de compte. Consultez Gérer les aperçus Databricks.
Cette page explique comment configurer les limites de débit pour les services d'IA Unity AI Gateway. Les limites de débit vous permettent d'appliquer des limites de consommation sur un service de modèle ou un service MCP afin de gérer la capacité et les coûts.
Exigences
- L'aperçu Unity AI Gateway est activé pour votre compte. Voir Gérer les aperçus Databricks.
- Un Workspace Databricks dans une région prise en charge par Unity AI Gateway.
Configurer les limites de débit sur un service de modèle ou un service MCP
Vous pouvez définir des limites de débit basées sur les requêtes par minute (QPM) ou les jetons par minute (TPM), selon le type de service :
- **Services de modèle** : Définissez des limites de requêtes par minute (QPM) et de jetons par minute (TPM).
- MCP services : définissez les limites de requêtes par minute (QPM). Les limites basées sur les jetons ne s'appliquent pas aux services MCP.
Pour activer les limites de débit, sélectionnez Limites de débit lors de la configuration de votre service de modèle ou de service MCP. Vous pouvez définir les limites de débit aux niveaux suivants :
Champ | Description |
|---|---|
Service | Spécifiez le nombre maximal de QPM ou TPM que l’ensemble du service peut gérer. Cette limite s’applique à tout le trafic, quel que soit l’utilisateur. |
Utilisateur (default) | Spécifiez une limite de débit par utilisateur par default qui s'applique à tous les utilisateurs du service, sauf si une limite de débit personnalisée plus spécifique est définie. |
Limites de débit personnalisées | Des limites de débit personnalisées peuvent être spécifiées pour :
|
Détails et comportement
- Les limites de débit s'appliquent uniquement aux utilisateurs autorisés à query le service.
- By default, aucune limite de débit n'est configurée pour les utilisateurs ou le service.
- La limite de débit du service est un maximum global. Si cette limite est dépassée, toutes les requêtes adressées au service sont bloquées, quelles que soient les limites de débit spécifiques à l'utilisateur ou au groupe.
- Si un service, un utilisateur ou un Service Principal Databricks dispose à la fois d'une limite de débit basée sur les requêtes et d'une limite de débit basée sur les jetons, la limite de débit la plus restrictive est appliquée.
- Les limites de débit personnalisées remplacent la limite de débit **Utilisateur (default)**.
- Si un utilisateur appartient à la fois à une limite spécifique à l'utilisateur et à une limite spécifique au groupe, la limite spécifique à l'utilisateur est appliquée.
- Si un utilisateur appartient à plusieurs groupes d'utilisateurs avec des limites de débit QPM ou TPM différentes, l'utilisateur est soumis à une limitation de débit s'il dépasse toutes les limites de débit QPM ou toutes les limites de débit TPM de ses groupes d'utilisateurs.
Comportement du limiteur de débit
Lorsqu’une limite de débit est dépassée, le service renvoie une réponse HTTP 429 (Trop de requêtes). Les clients devraient implémenter une logique de nouvelle tentative avec un intervalle exponentiel.
Le limiteur de débit est conçu pour une faible latence, ce qui signifie que les comportements suivants sont attendus :
- Les requêtes concurrentes ne sont pas vérifiées à l'avance. Le système enregistre l'utilisation après l'envoi d'une réponse. Ainsi, si plusieurs requêtes arrivent au même moment, elles peuvent toutes être traitées avant que l'utilisation ne soit comptabilisée. Les requêtes ultérieures sont alors rejetées jusqu'à ce que la capacité soit rétablie. En pratique, vous pouvez observer des pics de trafic suivis de brèves pauses, selon un schéma répétitif.
- Les limites sont appliquées indépendamment sur toutes les instances de service, de sorte que de courtes rafales légèrement supérieures à la limite configurée peuvent se produire, surtout juste après la création ou la mise à jour d'un service.
Sur une fenêtre de temps plus longue, le taux de requêtes moyen converge vers la limite configurée.
Limitations
- Vous pouvez spécifier un maximum de 20 limites de débit par service.
- Vous pouvez spécifier un maximum de 5 limites de débit spécifiques aux groupes par service.