Aller au contenu principal

Configurer la répartition du trafic et les fallbacks pour les services de modèles dans Unity AI Gateway

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs de compte peuvent contrôler l'accès à cette fonctionnalité depuis la page Aperçus de la console de compte. Consultez Gérer les aperçus Databricks.

Cette page décrit comment configurer le partage du trafic et les fallback pour les services de modèles Unity AI Gateway. Le partage du trafic distribue les requêtes sur plusieurs backends de modèles derrière un seul service de modèle. Utilisez-le pour déployer progressivement de nouveaux modèles, exécuter des tests A/B et répartir la charge entre les fournisseurs.

Les fallbacks ajoutent de la résilience aux agents et aux services de modèles grâce à des basculements redondants, augmentant ainsi la disponibilité globale et l'indépendance du modèle.

L'affinité de session maintient les requêtes de la même session sur la même destination.

Exigences

Configurer la répartition du trafic dans l’interface utilisateur

  1. Dans votre Workspace Databricks, cliquez sur **AI Gateway** dans la barre latérale et sélectionnez le service de modèle que vous souhaitez modifier.

  2. Dans la section **Destinations**, cliquez sur **Ajouter un autre modèle** pour ajouter une entrée de destination pour chaque backend de modèle que vous souhaitez inclure dans la répartition.

  3. Pour chaque destination, définissez le pourcentage de trafic sur la part de trafic que vous souhaitez que ce modèle reçoive.

    • Les pourcentages doivent totaliser 100 %.
  4. Le système enregistre les modifications automatiquement lorsque toutes les attributions totalisent 100 %.

Unity AI Gateway achemine aléatoirement chaque requête vers les destinations configurées selon les pourcentages de trafic que vous spécifiez. Au fil du temps, la part observée du trafic pour chaque destination converge vers les pourcentages configurés.

Affinité de session

Lorsque le fractionnement du trafic est configuré, Databricks active automatiquement l'affinité de session, qui achemine les requêtes de la même session vers la même destination. Le fait qu'une demande donnée soit pin dépend du client : les demandes qui incluent un en-tête d'identification de session sont acheminées par session, tandis que les demandes sans en-tête suivent la répartition pondérée du trafic.

Plutôt que d'appliquer la répartition pondérée du trafic à chaque requête, Unity AI Gateway pins chaque session à une seule destination, en tirant parti de la mise en cache de préfixes et en produisant des résultats prévisibles. Les sessions sont identifiées par des en-têtes standard pour la plupart des clients LLM et des agents de codage — un client regroupe ses requêtes dans une session en envoyant la même valeur d'en-tête sur chacune, et ces requêtes sont acheminées vers la même destination.

Interaction avec les fallback

Vous pouvez utiliser la répartition du trafic et les fallbacks ensemble, mais ils s'appliquent à différentes étapes de la gestion des requêtes :

  • Le partage de trafic détermine la destination initiale (principale) d'une requête.
  • Les fallbacks définissent la façon dont le système relance la requête si la tentative principale échoue.

Lorsque vous configurez à la fois la répartition du trafic et les fallback :

  1. Pour chaque demande entrante, la répartition du trafic sélectionne une destination parmi l'ensemble configuré, en fonction des pondérations. Cette sélection devient la destination principale de cette requête.
  2. Le système envoie la requête à la destination principale.
  3. Si la requête échoue (par exemple, en raison d’une erreur 429 ou 5xx), le système réessaye la requête par rapport aux destinations de fallback configurées. Il les essaie dans l’ordre exact spécifié.
  4. Le système tente les fallback séquentiellement jusqu'à ce que l'un d'eux réussisse ou qu'il épuise toutes les options de fallback.
remarque

Les fallbacks sont indépendants de la répartition du trafic. Une fois que le système a sélectionné une destination principale, il n'applique pas de nouveau le partage de trafic pendant les tentatives.

La répartition du trafic et les fallbacks s'appliquent à un service de modèle

Observabilité

Les décisions de routage pour les répartitions de trafic et les fallback sont consignées dans le champ routing_information de la table système system.ai_gateway.usage. Interrogez cette table pour vérifier que les requêtes sont acheminées conformément à vos pourcentages configurés et à l'ordre de fallback.

SQL
SELECT
destination_name AS destination,
COUNT(*) AS request_count,
ROUND(COUNT(*) * 100.0 / SUM(COUNT(*)) OVER (), 1) AS actual_pct
FROM system.ai_gateway.usage
WHERE
endpoint_name = 'your-endpoint-name'
AND event_time >= CURRENT_TIMESTAMP - INTERVAL 7 DAY
GROUP BY destination_name
ORDER BY actual_pct DESC;

Limitations

  • Vous pouvez configurer la répartition du trafic sur un maximum de 5 destinations.
  • Vous ne pouvez pas configurer la répartition du trafic sur des destinations de fallback.

Ressources supplémentaires