Aller au contenu principal

Genie Code pour l'observabilité et l'évaluation des agents

Genie Code fournit une interface en langage naturel pour comprendre, debugging et améliorer vos applications GenAI au sein de MLflow. Il a un accès en lecture à tout ce qui se trouve dans votre Experimentation, des traces, prompts et datasets aux exécutions d'évaluation, aux évaluateurs et aux sessions d'étiquetage, afin que vous puissiez explorer vos données d'observabilité et d'évaluation de manière conversationnelle au lieu d'écrire des queries ou de naviguer sur plusieurs pages de l'interface utilisateur.

Pour commencer, cliquez sur l'icône Genie Code en haut à droite de votre Workspace lors de la consultation d'une Experimentation.

Genie Code pour l'observabilité et l'évaluation des agents

Fonctionnalités

Genie Code peut vous aider avec un large éventail de tâches d'observabilité et d'évaluation, y compris :

  • Analyse des traces et débogage : examinez les traces défaillantes, trouvez les erreurs, étudiez les arborescences d'étendue, identifiez les causes profondes, analysez la latence et les goulots d'étranglement dans le flux d'exécution de votre agent. Plongez au cœur de n'importe quelle trace pour inspecter toute sa hiérarchie d'étendue, y compris les entrées, les sorties, les métadonnées et l'utilisation des jetons à chaque étape.
  • **Métriques et performances** : Calculez les percentiles de latence (P50/P95/P99), suivez les taux d'erreur et le throughput au fil du temps, analysez les modèles d'utilisation des jetons et les coûts, et comparez les performances sur différentes périodes ou filtres.
  • **Qualité et évaluations** : Passez en revue les scores d'évaluation issus du feedback humain, des juges LLM et des vérifications programmatiques. Inspectez les datasets d'évaluation, vérifiez les évaluateurs enregistrés et leurs configurations, et obtenez de l'aide pour configurer mlflow.genai.evaluate() avec les bons évaluateurs.
  • Étiquetage et révision : Affichez les sessions d’étiquetage et les personnes affectées à la révision des traces, et examinez les schémas d’étiquetage pour comprendre les critères de feedback tels que les évaluations, les commentaires et les attentes.
  • Registre de prompts : parcourez les prompts dans Unity Catalog, affichez les Template, les versions et les alias.
  • Conseils d’instrumentation : Obtenez de l’aide pour ajouter le traçage à votre code avec autolog(), @mlflow.trace ou des spans manuelles, avec des extraits de code exécutables que vous pouvez coller directement dans les Notebooks Databricks.

Exemples de questions

Voici quelques questions que vous pouvez poser à Genie Code :

  • « Aidez-moi à découvrir les problèmes avec l'appel d'outil de mon agent dans les traces pour cette experimentation au cours des 3 dernières heures »
  • « Identifiez les cas où les utilisateurs sont frustrés lors des conversations avec mon agent »
  • « Quelles sont les sessions qui ont les scores de commentaires utilisateur les plus bas, et qu’est-ce qui n’a pas fonctionné dans ces conversations ? »
  • « Quels sont les schémas d'échec les plus courants dans mes traces cette semaine, et quels marqueurs dois-je ajouter pour les détecter ? »
  • « Quelles périodes consomment le plus de jetons dans toutes mes traces ? »
  • « Rechercher les traces où le récupérateur n'a renvoyé aucun résultat, mais où l'agent a quand même essayé de répondre ».
  • « Aide-moi à configurer l'évaluation de mon agent RAG avec les bons évaluateurs »

Exigences

Pour utiliser Genie Code pour l'observabilité et l'évaluation des agents, votre Workspace a besoin des éléments suivants :

Ressources supplémentaires