Évaluer et surveiller les agents d'IA
MLflow fournit l'évaluation des agents et l'évaluation des LLM pour vous aider à mesurer, à améliorer et à maintenir la qualité de vos applications d'IA. MLflow prend en charge l'ensemble du cycle de vie du développement, des tests au monitoring de production pour les LLM, les agents, les systèmes RAG ou d'autres applications GenAI.
L'évaluation des agents d'IA et des LLM est plus complexe que l'évaluation des modèles ML traditionnels. Ces applications impliquent plusieurs composants, des conversations multi-tours et des critères de qualité nuancés. Les métriques qualitatives et quantitatives nécessitent des approches d'évaluation spécialisées pour évaluer précisément les performances.
Le composant d'évaluation et de monitoring de MLflow 3 est conçu pour vous aider à optimiser de manière itérative la qualité de votre application GenAI. L'évaluation et le monitoring s'appuient sur MLflow Tracing, qui fournit une journalisation des traces en temps réel pendant les phases de développement, de test et de production. Les traces peuvent être évaluées pendant le développement à l'aide de juges et d'évaluateurs LLM intégré ou personnalisés, et le monitoring de la production peut réutiliser les mêmes juges et évaluateurs, garantissant ainsi une évaluation cohérente tout au long du cycle de vie de l'application. Les experts du domaine peuvent fournir des commentaires à l'aide d'une application de révision intégrée pour la collecte des retours humains, produisant des données d'évaluation pour une itération ultérieure.
Le diagramme montre ce workflow itératif de haut niveau.

Fonctionnalité | Description |
|---|---|
Exécutez un Notebook de démonstration rapide qui présente l'évaluation MLflow à l'aide d'une simple application GenAI. | |
Suivez un tutoriel sur le flux de travail d'évaluation complet, à l'aide d'une application RAG simulée. Utilisez des datasets d'évaluation et des juges LLM pour évaluer la qualité, identifier les problèmes et améliorer de manière itérative votre application. | |
Définissez des métriques de qualité pour votre application à l’aide de juges LLM intégrés, de juges LLM personnalisés et de scorers personnalisés. Utilisez les mêmes métriques pour le développement et la production. | |
Testez votre application GenAI sur des datasets d’évaluation, à l’aide d’évaluateurs et de juges LLM. Comparez les versions de l’application, suivez les améliorations et partagez les résultats. | |
Évaluez la qualité des conversations à plusieurs tours avec des scorers spécialisés pour l’exhaustivité de la conversation, la frustration de l’utilisateur et la cohérence du dialogue. | |
Générez des conversations synthétiques multi-tours pour tester des agents d'IA conversationnelle avec des scénarios et des comportements d'utilisateur diversifiés. | |
Exécutez automatiquement des évaluateurs et des juges LLM sur les traces de vos applications GenAI de production pour surveiller la qualité en continu. | |
Utilisez l'application de révision pour recueillir les commentaires d'experts et créer des datasets d'évaluation. | |
Utilisez le langage naturel pour examiner les scores d'évaluation, inspecter les datasets d'évaluation, vérifier les scorers planifiés et obtenir de l'aide pour configurer |
Agent Evaluation est intégré à MLflow 3 géré. Les méthodes du SDK Agent Evaluation sont désormais disponibles à l’aide du SDK mlflow[databricks]>=3.1. Consultez Migrer vers MLflow 3 à partir d’Agent Evaluation pour mettre à jour votre code Agent Evaluation de MLflow 2 afin d’utiliser MLflow 3.