Passerelle d'IA pour les Endpoint de diffusion.
Essayez la nouvelle version Bêta de la passerelle d'IA Unity
Une nouvelle expérience Unity AI Gateway est disponible en Bêta. La nouvelle Unity AI Gateway est le plan de contrôle d’entreprise pour la gouvernance des Endpoint LLM et des agents de codage avec des fonctionnalités améliorées. Voir Gouvernance de l’IA avec Unity AI Gateway.
Cette page décrit AI Gateway pour les Endpoint de diffusion, qui gère et surveille l'accès aux modèles d'IA générative pris en charge et à leurs Endpoint de diffusion de modèles associés.
Qu'est-ce que l'AI Gateway pour la diffusion d'endpoints ?
AI Gateway est conçu pour rationaliser l'utilisation et la gestion des modèles et agents d'IA générative au sein d'une organisation. Il s'agit d'un service centralisé qui apporte la gouvernance, le monitoring et la préparation à la production aux endpoints de déploiement de modèles. Cela vous permet également d'exécuter, de sécuriser et de gouverner le trafic d'IA afin de démocratiser et d'accélérer l'adoption de l'IA pour votre organisation.
Toutes les données sont enregistrées dans des tables Delta dans Unity Catalog.
Pour start à visualiser les insights de vos données AI Gateway, download l'exemple de tableau de bord AI Gateway depuis GitHub. Ce tableau de bord exploite les données des tables d'inférence de suivi d'utilisation et de journalisation des charges utiles.
Après avoir download le fichier JSON, importez le tableau de bord dans votre workspace. Pour obtenir des instructions sur l'importation de tableaux de bord, consultez Importer un fichier de tableau de bord.
Fonctionnalités prises en charge
Unity AI Gateway
La nouvelle passerelle Unity AI propose une interface utilisateur riche, une meilleure observabilité et une couverture API élargie pour les LLM, incluant des modèles externes et des APIs de Foundation Model pay-per-token. Nous vous recommandons d'utiliser la Passerelle d'IA Unity pour débloquer ces nouvelles capacités.
Le tableau suivant définit les fonctionnalités disponibles d'AI Gateway et les types d'endpoint de service de modèle qui les prennent en charge.
Fonctionnalité | Définition | Endpoint de throughput provisionné pour les APIs des modèles de fondation. | ||||
|---|---|---|---|---|---|---|
Disponible dans Unity AI Gateway | Utilisez les fonctionnalités améliorées de Unity AI Gateway. Consultez la gouvernance de l'IA avec Unity AI Gateway. | Pris en charge | Pris en charge | Non pris en charge | Non pris en charge | Non pris en charge |
Autorisation et limitation du débit | Contrôlez qui a accès et quel niveau d’accès il a. | Pris en charge | Pris en charge | Pris en charge | Non pris en charge | Pris en charge |
Journalisation de la charge utile | Surveillez et auditez les données envoyées aux APIs de modèle à l'aide des tables d'inférence. | Pris en charge | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Suivi de l'utilisation | Surveillez l'utilisation opérationnelle des Endpoint et les coûts associés à l'aide des tables système. | Pris en charge | Pris en charge | Pris en charge | Non pris en charge | Pris en charge |
Garde-fous pour l’IA | Évitez les données indésirables et dangereuses dans les demandes et les réponses. Consultez les garde-fous IA. | Pris en charge | Pris en charge | Pris en charge | Non pris en charge | Non pris en charge |
Fallbacks | Minimisez les interruptions de production pendant et après le déploiement. | Pris en charge | Non pris en charge | Non pris en charge | Non pris en charge | Non pris en charge |
Répartition du trafic | Équilibrer le trafic entre les modèles. | Pris en charge | Non pris en charge | Pris en charge | Non pris en charge | Pris en charge |
AI Gateway entraîne des frais en fonction des fonctionnalités activées. Les fonctionnalités payantes comprennent la journalisation de la charge utile et le suivi de l'utilisation. Les fonctionnalités telles que les autorisations de query, la limitation du débit, les fallbacks et la répartition du trafic sont gratuits. Toute nouvelle fonctionnalité est soumise à des frais.
Garde-fous IA
Aperçu
Cette fonctionnalité est en aperçu public.
Les garde-fous d'IA permettent aux utilisateurs de configurer et d'appliquer la conformité des données au niveau de l'Endpoint de service de modèle et de réduire les contenus nuisibles sur toutes les requêtes envoyées au modèle sous-jacent. Les requêtes et réponses incorrectes sont bloquées et un message default est renvoyé à l'utilisateur. Découvrez comment configurer des garde-fous sur un Endpoint de service de modèle.
Le service de modération AI Guardrails dépend des modèles d'APIs Foundation Model à paiement par jeton. Cette dépendance limite la disponibilité du service de modération AI Guardrails aux régions qui prennent en charge le paiement par jeton des APIs de modèle de fondation. Les régions qui nécessitent une activation inter-régionale pour utiliser le paiement par jeton des APIs de modèle de fondation ne prennent pas en charge AI Guardrails.
Le tableau suivant récapitule les garde-fous configurables. Consulter Limitations.
Garde-fou | Définition |
|---|---|
Filtrage de sécurité | Le filtrage de sécurité empêche votre modèle d’interagir avec du contenu dangereux et nuisible, comme les crimes violents, l’automutilation et les discours haineux. Le filtre de sécurité d'AI Gateway est conçu avec Meta Llama 3. Databricks utilise Llama Guard 2-8b comme filtre de sécurité. Pour en savoir plus sur le filtre de sécurité Llama Guard et les sujets applicables au filtre de sécurité, consultez la fiche de modèle Meta Llama Guard 2 8B. Meta Llama 3 est sous licence LLAMA 3 Communauté License, Copyright © Meta Platforms, Inc. Tous droits réservés. Les clients sont responsables de la conformité avec les licences de modèle applicables. |
Détection des informations personnellement identifiables (PII) | Les clients peuvent détecter toute information sensible, telle que les numéros de carte de crédit des utilisateurs. Pour cette fonctionnalité, AI Gateway utilise Presidio pour détecter les catégories suivantes de PII aux États-Unis : numéros de carte de crédit, adresses e-mail, numéros de téléphone, numéros de compte bancaire et numéros de sécurité sociale. Le classificateur PII peut aider à identifier les informations sensibles ou les PII dans les données structurées et non structurées. Cependant, étant donné qu'il utilise des mécanismes de détection automatisés, il n'y a aucune garantie que le service trouve toutes les informations sensibles. Par conséquent, des systèmes et des protections supplémentaires devraient être mis en œuvre. Ces méthodes de classification sont principalement conçues pour les catégories américaines de PII, telles que les numéros de téléphone américains et les numéros de sécurité sociale. |
Utiliser la passerelle IA
Vous pouvez configurer les fonctionnalités de l'AI Gateway sur vos endpoints de service de modèles à l'aide de l'interface utilisateur de service. Consultez Configurer la passerelle IA sur les Endpoint de diffusion de modèles.
Limitations
Voici les limitations pour les Endpoint compatibles avec AI Gateway :
- Lorsque les garde-fous d'IA sont utilisés, la taille de batch de la requête, c'est-à-dire la taille de batch des embeddings, la taille de batch des complétions, ou le
nparameter des requêtes de chat, ne peut pas dépasser 16. - Si vous utilisez l'appel de fonction et spécifiez des garde-fous de l'IA, ces garde-fous ne sont pas appliqués aux requêtes et aux réponses intermédiaires de la fonction. Cependant, les garde-fous sont appliqués à la réponse de sortie finale.
- Les workloads de texte vers image ne sont pas pris en charge.
- Seul le suivi de l'utilisation est pris en charge pour les workloads d'inférence batch sur les Endpoint payants par jeton qui ont les fonctionnalités AI Gateway activées. Dans la table système
endpoint_usage, seules les lignes correspondant à la requête d'inférence batch sont visibles. - Les garde-fous IA et les fallback ne sont pas pris en charge sur les Endpoints de mise en service de modèles personnalisés.
- Pour les endpoints de déploiement de modèles personnalisés, seules les charges de travail qui ne sont pas optimisées pour l'itinéraire prennent en charge la limitation du débit et le suivi de l'utilisation.
- Les tables d'inférence pour les Endpoint de diffusion de modèles optimisés par itinéraire sont en Public Preview.
- Consultez les Limitations des tables d'inférence activées par AI Gateway pour plus de détails sur les limitations des tables d'inférence.