Aller au contenu principal

Qu’est-ce que l’observabilité et la qualité des agents ?

astuce

Vous utilisez un agent de codage ?

Si vous utilisez un agent de codage tel que Claude Code, Cursor, VS Code ou OpenCode, installez nos compétences afin qu’il puisse interagir efficacement avec MLflow :

Bash
uvx mlflow agent setup

Cela configure le tab de l'agent de codage que vous verrez sur les tâches dans l'ensemble de ces documents. Veuillez consulter Configurer un agent de codage et Configurer le serveur MCP MLflow.

Agent observability and quality is the practice of measuring, debugging, and improving your AI agent from your first trace through production. On Databricks, you do this with MLflow . MLflow on Databricks is MLflow — the same open source produit, just managed and integrated with the Databricks platform, so your traces, evaluations, and prompts live in Unity Catalog alongside the rest of your data.

start with traces

Le traçage des agents capture un enregistrement complet de chaque exécution d'agent. Une trace comprend l'entrée initiale et la sortie finale, ainsi que chaque étape intermédiaire — telle que les appels de modèle, les appels d'outils et la récupération — avec les entrées, les sorties, la latence, l'utilisation des jetons et le coût pour chaque étape.

Le traçage constitue le fondement de l’observabilité et de la qualité des agents. Il vous permet d’analyser l’utilisation que font les utilisateurs de votre agent ainsi que le temps et l’argent que cela mobilise. Plus important encore, il vous fournit les éléments factuels nécessaires pour améliorer un agent. Avec seulement une entrée et une réponse finale, vous ne pouvez pas déterminer quelle décision intermédiaire a provoqué une défaillance. Les traces vous permettent d’inspecter chaque étape, de diagnostiquer le problème, de recueillir des commentaires dans leur contexte et de convertir des échecs représentatifs en datasets d’évaluation et de référence.

Vous utilisez les traces pour :

  • Analysez l'utilisation, la latence, la consommation de jetons et le coût de l'agent.
  • Déboguez les échecs lors des appels de modèle, de la récupération et de l’utilisation d’outils.
  • Collect human feedback in the context of the execution being reviewed.
  • Créez des datasets d’évaluation et de référence à partir d’échecs de production représentatifs.
  • Run evaluations and monitor quality in production.

La boucle de qualité

Améliorer un agent n'est pas une étape unique — c'est une boucle que vous exécutez en continu. Chaque réussite corrige un problème et fait apparaître le suivant.

La boucle de qualité des agents : tracer, identifier un problème, recueillir des commentaires et organiser un dataset, écrire un évaluateur, corriger l'agent, évaluer et surveiller la production — ce qui fait apparaître le problème suivant.

  1. Tracez votre agent. Instrumentez votre agent de manière à ce que chaque exécution soit capturée sous forme de trace — l’élément sur lequel repose chaque étape ultérieure.
  2. Rechercher un problème. Repérez une défaillance dans vos traces de développement, ou détectez une régression en production.
  3. Recueillez les commentaires et constituez un dataset. Examinez les traces en échec avec des développeurs, des experts du domaine ou des utilisateurs. Enregistrez les commentaires sur la trace afin qu'elle reste connectée à l'exécution en cours d'examen, puis transformez les échecs représentatifs et les exemples validés en un dataset d'évaluation ou de référence.
  4. Écrire un évaluateur. Définissez un évaluateur (un juge LLM ou une vérification basée sur du code) qui détecte automatiquement le problème.
  5. Corrigez l’agent. Itérez sur votre prompt ou votre agent pour remédier à la cause profonde.
  6. Évaluez la correction. Relancez l’évaluation sur votre dataset pour confirmer la correction et vous assurer que vous n’avez rien cassé d’autre.
  7. Surveillez la production. Exécutez vos évaluateurs sur le trafic en direct pour éviter que le problème ne se reproduise — ce qui permet de surface le suivant à corriger.

Le parcours

Start par le haut si vous débutez ; passez directement à une étape si vous savez déjà où vous en êtes.

    • Instrumenter votre agent
    • Ajoutez le traçage pour capturer chaque entrée, étape et sortie. Les traces sont stockées dans Unity Catalog (recommandé) — régies, interrogeables en SQL et constituant la base de données pour le reste.
    • Observer & trouver les problèmes d’agent
    • Explorez les traces dans l’interface utilisateur et posez des questions en langage naturel avec Genie Code — aucun SQL requis. Regroupez les traces par cluster pour mettre en évidence les modes de défaillance récurrents et identifier les problèmes plus rapidement.
    • Évaluer & améliorer la qualité
    • Exécutez des évaluations à l’aide d’évaluateurs intégrés et personnalisés, puis affinez votre prompt et votre agent pour corriger ce que vous avez découvert.
    • Surveiller en production
    • Attribuez des scores au trafic en direct en continu pour intercepter les régressions et détecter les nouveaux problèmes avant vos utilisateurs.

Vous préférez travailler sur une seule tâche à la fois ? Parcourez les recettes d'observabilité des agents pour obtenir des guides ciblés prêts à l'emploi, de la configuration d'un agent de codage à la création de juges LLM personnalisés.

Étape suivante

Prêt à start la boucle ? Instrumentez votre agent pour capturer vos premières traces.