Aller au contenu principal

Évaluer et surveiller les agents d'IA

MLflow fournit l'évaluation des agents et l'évaluation des LLM pour vous aider à mesurer, à améliorer et à maintenir la qualité de vos applications d'IA. MLflow prend en charge l'ensemble du cycle de vie du développement, des tests au monitoring de production pour les LLM, les agents, les systèmes RAG ou d'autres applications GenAI.

L'évaluation des agents d'IA et des LLM est plus complexe que l'évaluation des modèles ML traditionnels. Ces applications impliquent plusieurs composants, des conversations multi-tours et des critères de qualité nuancés. Les métriques qualitatives et quantitatives nécessitent des approches d'évaluation spécialisées pour évaluer précisément les performances.

Le composant d'évaluation et de monitoring de MLflow 3 est conçu pour vous aider à optimiser de manière itérative la qualité de votre application GenAI. L'évaluation et le monitoring s'appuient sur MLflow Tracing, qui fournit une journalisation des traces en temps réel pendant les phases de développement, de test et de production. Les traces peuvent être évaluées pendant le développement à l'aide de juges et d'évaluateurs LLM intégré ou personnalisés, et le monitoring de la production peut réutiliser les mêmes juges et évaluateurs, garantissant ainsi une évaluation cohérente tout au long du cycle de vie de l'application. Les experts du domaine peuvent fournir des commentaires à l'aide d'une application de révision intégrée pour la collecte des retours humains, produisant des données d'évaluation pour une itération ultérieure.

Le diagramme montre ce workflow itératif de haut niveau.

Diagramme de présentation de l'évaluation et du monitoring de MLflow 3

Fonctionnalité

Description

Démo de 10 minutes : Évaluez une application GenAI

Exécutez un Notebook de démonstration rapide qui présente l'évaluation MLflow à l'aide d'une simple application GenAI.

Tutoriel : Évaluer et améliorer une application GenAI

Suivez un tutoriel sur le flux de travail d'évaluation complet, à l'aide d'une application RAG simulée. Utilisez des datasets d'évaluation et des juges LLM pour évaluer la qualité, identifier les problèmes et améliorer de manière itérative votre application.

Évaluateurs et juges LLM

Définissez des métriques de qualité pour votre application à l’aide de juges LLM intégrés, de juges LLM personnalisés et de scorers personnalisés. Utilisez les mêmes métriques pour le développement et la production.

Évaluer pendant le développement

Testez votre application GenAI sur des datasets d’évaluation, à l’aide d’évaluateurs et de juges LLM. Comparez les versions de l’application, suivez les améliorations et partagez les résultats.

Évaluer les conversations

Évaluez la qualité des conversations à plusieurs tours avec des scorers spécialisés pour l’exhaustivité de la conversation, la frustration de l’utilisateur et la cohérence du dialogue.

Simulation de conversation

Générez des conversations synthétiques multi-tours pour tester des agents d'IA conversationnelle avec des scénarios et des comportements d'utilisateur diversifiés.

Surveiller les applications en production (Bêta)

Exécutez automatiquement des évaluateurs et des juges LLM sur les traces de vos applications GenAI de production pour surveiller la qualité en continu.

Recueillir les retours humains

Utilisez l'application de révision pour recueillir les commentaires d'experts et créer des datasets d'évaluation.

Genie Code pour l'observabilité et l'évaluation des agents

Utilisez le langage naturel pour examiner les scores d'évaluation, inspecter les datasets d'évaluation, vérifier les scorers planifiés et obtenir de l'aide pour configurer mlflow.genai.evaluate() avec les bons scorers.

Fonctionnalité

Description

Démo de 10 minutes : Évaluez une application GenAI

Exécutez un Notebook de démonstration rapide qui présente l'évaluation MLflow à l'aide d'une simple application GenAI.

Tutoriel : Évaluer et améliorer une application GenAI

Suivez un tutoriel sur le flux de travail d'évaluation complet, à l'aide d'une application RAG simulée. Utilisez des datasets d'évaluation et des juges LLM pour évaluer la qualité, identifier les problèmes et améliorer de manière itérative votre application.

Évaluateurs et juges LLM

Définissez des métriques de qualité pour votre application à l’aide de juges LLM intégrés, de juges LLM personnalisés et de scorers personnalisés. Utilisez les mêmes métriques pour le développement et la production.

Évaluer pendant le développement

Testez votre application GenAI sur des datasets d’évaluation, à l’aide d’évaluateurs et de juges LLM. Comparez les versions de l’application, suivez les améliorations et partagez les résultats.

Évaluer les conversations

Évaluez la qualité des conversations à plusieurs tours avec des scorers spécialisés pour l’exhaustivité de la conversation, la frustration de l’utilisateur et la cohérence du dialogue.

Simulation de conversation

Générez des conversations synthétiques multi-tours pour tester des agents d'IA conversationnelle avec des scénarios et des comportements d'utilisateur diversifiés.

Surveiller les applications en production (Bêta)

Exécutez automatiquement des évaluateurs et des juges LLM sur les traces de vos applications GenAI de production pour surveiller la qualité en continu.

Recueillir les retours humains

Utilisez l'application de révision pour recueillir les commentaires d'experts et créer des datasets d'évaluation.

Genie Code pour l'observabilité et l'évaluation des agents

Utilisez le langage naturel pour examiner les scores d'évaluation, inspecter les datasets d'évaluation, vérifier les scorers planifiés et obtenir de l'aide pour configurer mlflow.genai.evaluate() avec les bons scorers.

remarque

Agent Evaluation est intégré à MLflow 3 géré. Les méthodes du SDK Agent Evaluation sont désormais disponibles à l’aide du SDK mlflow[databricks]>=3.1. Consultez Migrer vers MLflow 3 à partir d’Agent Evaluation pour mettre à jour votre code Agent Evaluation de MLflow 2 afin d’utiliser MLflow 3.