Configurer AI Gateway sur les endpoints de service de modèle
Essayez la nouvelle version Bêta de la passerelle d'IA Unity
Une nouvelle expérience Unity AI Gateway est disponible en Bêta. La nouvelle Unity AI Gateway est le plan de contrôle d’entreprise pour la gouvernance des Endpoint LLM et des agents de codage avec des fonctionnalités améliorées. Voir Gouvernance de l’IA avec Unity AI Gateway.
Dans cet article, vous apprendrez à configurer AI Gateway sur un endpoint de service de modèle.
Exigences
-
Un workspace Databricks dans une région où la diffusion de modèles est prise en charge. Voir la disponibilité des fonctionnalités de Model Serving.
-
Un Endpoint de service de modèle. Vous pouvez utiliser l'un des Endpoint préconfigurés de paiement par jeton sur votre Workspace ou effectuer les opérations suivantes :
- Pour créer un endpoint pour les modèles externes, suivez les étapes 1 et 2 de Créer un endpoint de déploiement de modèles externes.
- Pour créer un endpoint pour un throughput provisionné, consultez APIs de modèles de fondation à throughput provisionné.
- Pour créer un endpoint pour un modèle personnalisé, consultez Créer un endpoint.
-
Les opérations d'administration d'Endpoint nécessitent
CAN MANAGEsur cet Endpoint. Voir les listes de contrôle d'accès. -
Lors de la création, le créateur se voit accorder
CAN MANAGEsur le nouvel Endpoint. -
Pour éviter de contourner les garde-fous ou les limites de throughput, limitez la création d’Endpoint et
CAN MANAGEaux administrateurs, et accordez aux autres utilisateurs uniquement des autorisations de query sur les endpoints approuvés.
Configurer la passerelle d'IA Unity à l'aide de l'interface utilisateur
Dans la section AI Gateway de la page de création d'endpoint, vous pouvez configurer individuellement les fonctionnalités de Unity AI Gateway. Consultez Fonctionnalités prises en charge pour connaître les fonctionnalités disponibles sur les endpoints de service de modèles externes et les endpoints à throughput provisionné.

Le tableau suivant résume comment configurer Unity AI Gateway lors de la création d'Endpoint en utilisant l'interface utilisateur de Serving. Si vous préférez le faire par programmation, consultez l'exemple de Notebook.
Fonctionnalité | Comment activer | Détails |
|---|---|---|
Suivi de l'utilisation | Sélectionnez Activer le suivi de l'utilisation pour activer le suivi et le monitoring des métriques d'utilisation des données. |
|
Journalisation de la charge utile | Sélectionnez Activer les tables d'inférence pour enregistrer automatiquement les requêtes et les réponses depuis votre Endpoint dans les tables Delta gérées par Unity Catalog. |
|
Consultez Configurer les garde-fous de l'IA dans l'interface utilisateur. |
| |
Limites de débit | Sélectionnez Limites de taux pour gérer et spécifier le nombre de query par minute (QPM) ou de jetons par minute (TPM) que votre Endpoint peut prendre en charge.
|
|
Répartition du trafic | Dans la section **Entités servies**, spécifiez le **pourcentage de trafic** que vous souhaitez acheminer vers des modèles spécifiques. Pour configurer la répartition du trafic sur votre Endpoint par programmation, consultez Servir plusieurs modèles externes à un Endpoint. |
|
Fallbacks | Sélectionnez Activer les fallbacks dans la section Passerelle IA pour envoyer votre demande à d'autres modèles servis sur l'endpoint en tant que fallback. |
|
Le diagramme suivant montre un exemple de fallbacks, où
- Trois entités servies sont déployées sur un endpoint de service de modèle.
- La requête est initialement acheminée vers l'entité desservie 3 .
- Si la requête renvoie une réponse 200, la requête a abouti sur l'entité Served entity 3 et la requête ainsi que sa réponse sont journalisées dans les tables de suivi de l'utilisation et de journalisation des charges utiles de l'Endpoint.
- Si la requête renvoie une erreur 429 ou 5xx sur l' entité servie 3 , la requête bascule vers l'entité servie suivante sur l'Endpoint, l' entité servie 1 .
- Si la requête renvoie une erreur 429 ou 5xx sur l' entité servie 1 , la requête bascule vers l'entité servie suivante sur l'Endpoint, l' entité servie 2 .
- Si la requête renvoie une erreur 429 ou 5xx sur *Served entity 2*, la requête échoue car il s’agit du nombre maximal d’entités de secours. La requête ayant échoué et l'erreur de réponse sont enregistrées dans les tables de suivi d'utilisation et de Logs de charge utile.

Configurez les Garde-fous IA dans l'interface utilisateur.
Aperçu
Cette fonctionnalité est en aperçu public.
Le tableau suivant montre comment configurer les garde-fous pris en charge.
Garde-fou | Comment activer |
|---|---|
Sécurité | Sélectionnez Sécurité pour activer les garde-fous afin d'empêcher votre modèle d'interagir avec du contenu dangereux et nuisible. |
Détection des informations personnellement identifiables (PII) | Sélectionnez pour **Bloquer** ou **Masquer** les données DCP telles que les noms, les adresses, les numéros de carte de crédit si de telles informations sont détectées dans les requêtes et les réponses des Endpoint. Sinon, sélectionnez **None** pour qu'aucune détection des PII ne soit effectuée. |

Schémas de table de suivi d'utilisation
Les sections suivantes résument les schémas de table de suivi d'utilisation pour les tables système system.serving.served_entities et system.serving.endpoint_usage.
Schéma de la table de suivi d'utilisationsystem.serving.served_entities
La table système de suivi d’utilisation system.serving.served_entities a le schéma suivant :
Nom de colonne | Description | Type |
|---|---|---|
| L’ID unique de l’entité servie. | CHAÎNE |
| L'ID de compte client pour OpenSharing. | CHAÎNE |
| L'ID de workspace client de l'endpoint de service. | CHAÎNE |
| Le nom de l'auteur. Peut être un nom d'utilisateur, de Service Principal ou de groupe. Pour les endpoints à paiement par jeton, il s'agit de | CHAÎNE |
| Le nom de l'endpoint de service. | CHAÎNE |
| L'ID unique de l'endpoint de service. | CHAÎNE |
| Le nom de l'entité servie. | CHAÎNE |
| Type d'entité servie. Peut être | CHAÎNE |
| Le nom sous-jacent de l'entité. Différent de | CHAÎNE |
| La version de l'entité servie. | CHAÎNE |
| La version de la configuration du Endpoint. | INT |
| Le type de tâche. Peut être | CHAÎNE |
| Configurations pour les modèles externes. Par exemple, | Structure |
| Configurations des modèles de fondation. Par exemple, | Structure |
| Configurations pour les modèles personnalisés. Par exemple, | Structure |
| Configurations pour les spécifications de fonctionnalités. Par exemple, | Structure |
| Timestamp de modification pour l'entité servie. | Horodatage |
| Timestamp de la suppression de l'entité. L'endpoint est le conteneur de l'entité servie. Une fois l'endpoint supprimé, l'entité servie est également supprimée. | Horodatage |
Schéma de la table de suivi d'utilisationsystem.serving.endpoint_usage
La table système de suivi d’utilisation system.serving.endpoint_usage a le schéma suivant :
Nom de colonne | Description | Type |
|---|---|---|
| L'ID de compte du client. | CHAÎNE |
| L'ID de workspace client de l'endpoint de mise en service. | CHAÎNE |
| L'identifiant de requête fourni par l'utilisateur peut être spécifié dans le corps de la requête du service de modèle. Pour les Endpoint de modèle personnalisés, cela n'est pas pris en charge pour les requêtes supérieures à 4 MiB. | CHAÎNE |
| Un identifiant de requête généré par Databricks attaché à toutes les requêtes de diffusion de modèle. | CHAÎNE |
| L'ID de l'utilisateur ou du service principal dont les autorisations sont utilisées pour la requête d'invocation de l'endpoint de service. | CHAÎNE |
| Le code de statut HTTP qui a été renvoyé par le modèle. | INTEGER |
| Timestamp auquel la requête est reçue. | Horodatage |
| Le nombre de jetons de l'entrée. Ce sera 0 pour les requêtes de modèle personnalisé. | LONG |
| Le nombre de jetons de la sortie. Ce sera 0 pour les requêtes de modèle personnalisé. | LONG |
| Le nombre de caractères de la chaîne d'entrée ou de l'invite. Ce sera 0 pour les requêtes de modèle personnalisé. | LONG |
| Le nombre de caractères de la chaîne de sortie de la réponse. Ce sera 0 pour les requêtes de modèle personnalisé. | LONG |
| La carte fournie par l'utilisateur contenant les identifiants de l'utilisateur final ou de l'application cliente qui effectue l'appel à l'Endpoint. Consultez Définir plus précisément l'utilisation avec | Carte |
| Si la requête est en mode stream. | Booléen |
| L'ID unique utilisé pour joindre la table de dimensions | CHAÎNE |
Définir davantage l'utilisation avec usage_context
Lorsque vous interrogez un modèle externe avec le suivi d’utilisation activé, vous pouvez fournir le paramètre usage_context de type Map[String, String]. Le mappage du contexte d'utilisation apparaît dans la table de suivi de l'utilisation dans la colonne usage_context. La taille de la carte usage_context ne peut pas dépasser 10 KiB.
{
"messages": [
{
"role": "user",
"content": "What is Databricks?"
}
],
"max_tokens": 128,
"usage_context":
{
"use_case": "external",
"project": "project1",
"priority": "high",
"end_user_to_charge": "abcde12345",
"a_b_test_group": "group_a"
}
}
Si vous utilisez le client Python OpenAI, vous pouvez spécifier le usage_context en l'incluant dans le parameter extra_body.
from openai import OpenAI
client = OpenAI(
api_key="dapi-your-databricks-token",
base_url="https://example.staging.cloud.databricks.com/serving-endpoints"
)
response = client.chat.completions.create(
model="databricks-claude-sonnet-4-5",
messages=[{"role": "user", "content": "What is Databricks?"}],
temperature=0,
extra_body={"usage_context": {"project": "project1"}},
)
answer = response.choices[0].message.content
print("Answer:", answer)
Les administrateurs de compte peuvent agréger différentes lignes en fonction du contexte d'utilisation pour obtenir des insights et peuvent joindre ces informations avec les informations de la table de journalisation des charges utiles. Par exemple, vous pouvez ajouter end_user_to_charge au usage_context pour le suivi de l'attribution des coûts aux utilisateurs finaux.
Surveiller l'utilisation des Endpoint.
Pour surveiller l'utilisation de l'Endpoint, vous pouvez joindre les tables système et les tables d'inférence pour votre Endpoint.
Joindre des tables système
Cet exemple s'applique aux endpoints de modèle externes, de throughput provisionné, de paiement au jeton et personnalisés.
Pour joindre les tables système endpoint_usage et served_entities, utilisez le SQL suivant :
SELECT * FROM system.serving.endpoint_usage as eu
JOIN system.serving.served_entities as se
ON eu.served_entity_id = se.served_entity_id
WHERE created_by = "\<user_email\>";
Mettre à jour les fonctionnalités de Unity AI Gateway sur les endpoints
Vous pouvez mettre à jour les fonctionnalités de Unity AI Gateway sur les endpoints de service de modèle qui les avaient déjà activées et sur les endpoints qui ne les avaient pas. Les mises à jour des configurations de Unity AI Gateway prennent environ 20 à 40 secondes pour être appliquées, toutefois les mises à jour de la limitation de débit peuvent prendre jusqu'à 60 secondes.
Ce qui suit montre comment mettre à jour les fonctionnalités d'Unity AI Gateway sur un Endpoint de service de modèle à l'aide de l'interface utilisateur de service.
Dans la section Gateway de la page d'endpoint, vous pouvez voir les fonctionnalités activées. Pour mettre à jour ces fonctionnalités, cliquez sur Modifier la passerelle d'IA Unity .

Exemple de Notebook
Le notebook suivant montre comment activer et utiliser par programme les fonctionnalités de la passerelle Databricks Unity AI pour gérer et gouverner les modèles des fournisseurs. Consultez le PUT /api/2.0/serving-endpoints/{name}/ai-gateway pour les détails de l'API REST.