MLflow 3 pour GenAI
MLflow 3 pour la GenAI est une plateforme ouverte qui unifie le suivi, l'évaluation et l'observabilité des applications et agents GenAI tout au long du cycle de vie du développement et de la production. Il inclut la journalisation des traces en temps réel, des scorers intégrés et personnalisés, l'intégration des commentaires humains et le suivi des versions pour vous aider à évaluer et à améliorer efficacement la qualité des applications pendant le développement et à continuer de suivre et d'améliorer la qualité en production.
Managed MLflow sur Databricks étend MLflow open source avec des capacités conçues pour les applications GenAI de production, y compris une gouvernance prête pour l'entreprise, un hébergement entièrement managé, une mise à l'échelle au niveau de la production et une intégration avec vos données dans le lakehouse Databricks et Unity Catalog.
Pour des informations sur l'évaluation des agents dans MLflow 2, consultez Agent Evaluation (MLflow 2) et le guide de migration. Pour MLflow 3, les méthodes du SDK d'Agent Evaluation ont été intégrées à MLflow géré par Databricks.
Pour une série de tutoriels pour vous aider à start, see start.
Comment MLflow 3 aide à optimiser la qualité des applications GenAI
L'évaluation des applications et des agents GenAI est plus complexe que l'évaluation des logiciels traditionnels. Les entrées et les sorties sont souvent du texte libre, et de nombreuses sorties différentes peuvent être considérées comme correctes. La qualité dépend non seulement de l'exactitude, mais aussi de facteurs tels que la précision, la longueur, l'exhaustivité, la pertinence et d'autres critères spécifiques au cas d'utilisation. Étant donné que les LLM sont intrinsèquement non déterministes et que les agents GenAI incluent des composants supplémentaires tels que des récupérateurs et des outils, leurs réponses peuvent varier d'une exécution à l'autre.
Les développeurs ont besoin de métriques de qualité concrètes, d'une évaluation automatisée et d'un monitoring continu pour créer et déployer des applications d'IA robustes. MLflow 3 pour GenAI fournit ces éléments clés pour un développement, un déploiement et une amélioration continue efficaces :
- Le traçage enregistre automatiquement les entrées, les étapes intermédiaires et les sorties, et fournit la base de données pour l’évaluation et le monitoring.
- Les juges et évaluateurs LLM intégrés et personnalisés vous permettent de définir différents aspects de la qualité et de personnaliser les métriques en fonction de votre cas d'utilisation.
- Les applications d'examen pour les commentaires d'experts vous permettent de collecter et d'étiqueter des datasets pour l'évaluation et d'aligner les juges et les évaluateurs automatisés sur le jugement d'experts.
- L'évaluation et le monitoring automatisés tirent parti des mêmes juges et évaluateurs pendant le développement et la production.
- Le versioning d'applications et de prompts vous permet de comparer les versions et de suivre les améliorations au fil des itérations.
En utilisant MLflow 3 sur Databricks, vous pouvez rapprocher l’IA de vos données afin de vous aider à comprendre en profondeur et à améliorer la qualité. Unity Catalog assure une gouvernance cohérente pour les invites, les applications et les traces. Avec n'importe quel modèle ou framework, MLflow vous accompagne tout au long du cycle de développement, jusqu'à et en production.
Get start
Start building better GenAI applications with comprehensive observability and evaluation tools.
Tâche | Description |
|---|---|
Soyez opérationnel en quelques minutes grâce à des instructions étape par étape pour instrumenter votre première application avec le traçage, exécuter l'évaluation et recueillir les commentaires humains. | |
Bien démarrer : MLflow Tracing pour GenAI (Databricks Notebook) | Instrumentez une application GenAI simple pour capturer automatiquement des traces détaillées pour le debugging et l'optimisation. |
Vous accompagne dans l'évaluation d'une application de génération d'e-mails qui utilise la Génération augmentée de récupération (RAG). | |
Collectez les retours des utilisateurs finaux, ajoutez des annotations de développeur, créez des sessions d'évaluation par des experts, et utilisez ces retours pour évaluer la qualité de votre application GenAI. |
Traçage
MLflow Tracing assure l’observabilité et consigne les données de trace nécessaires à l’évaluation et au monitoring.
Fonctionnalité | Description |
|---|---|
Observabilité de bout en bout pour les applications GenAI, y compris les systèmes complexes basés sur des agents. Suivez les entrées, les sorties, les étapes intermédiaires et les métadonnées pour une vue d'ensemble complète de la façon dont votre application se comporte. | |
Introduction aux concepts de traçage. | |
Passez en revue le comportement et les performances de votre application. | Une visibilité complète de l'exécution vous permet de capturer les invites, les récupérations, les appels d'outils, les réponses, la latence et les coûts. |
Utilisez la même instrumentation dans les environnements de développement et de production pour une évaluation cohérente. | |
Analysez les traces pour identifier les problèmes de qualité, sélectionnez les traces représentatives, créez des jeux de données d'évaluation et améliorez systématiquement votre application. | |
MLflow Tracing est intégré à de nombreuses bibliothèques et frameworks pour un traçage automatique qui vous permet d’obtenir une observabilité immédiate de vos applications GenAI avec une configuration minimale. | |
Utilisez le langage naturel pour analyser les traces, déboguer les erreurs, examiner les résultats d'évaluation, inspecter les évaluateurs et obtenir des conseils d'instrumentation — directement au sein de votre expérimentation. |
Évaluation et monitoring
Remplacez les tests manuels par une évaluation automatisée à l'aide de juges LLM et de scorers intégrés et personnalisés qui correspondent à l'expertise humaine et peuvent être appliqués en développement et en production. Chaque interaction de production devient une occasion de s'améliorer grâce à des commentaires intégrés et des workflows d'évaluation.
Fonctionnalité | Description |
|---|---|
Présentation de l’évaluation et du monitoring des agents à l’aide de MLflow 3 sur Databricks. | |
MLflow 3 inclut des juges LLM intégrés pour la sécurité, la pertinence, l’exactitude, la qualité de récupération et plus encore. Vous pouvez également créer des juges LLM personnalisés et des évaluateurs basés sur du code pour répondre à vos besoins métier spécifiques. | |
Exécutez l'évaluation pendant le développement ou dans le cadre d'un processus de publication. | |
Surveillez en continu un échantillon du trafic de production à l'aide de juges et d'évaluateurs LLM. | |
Recueillez et utilisez les commentaires des experts du domaine et des utilisateurs finaux pendant le développement et la production pour une amélioration continue. | |
Demandez à Genie Code de revoir les scores d’évaluation, d’inspecter les datasets d’évaluation, de vérifier les configurations du marqueur et d’aider à configurer l’évaluation de votre agent à l’aide du langage naturel. |
Gérer le cycle de vie des applications GenAI
Versionnez, suivez et gouvernez votre application GenAI complète avec des outils de gestion du cycle de vie et de gouvernance de niveau entreprise.
Fonctionnalité | Description |
|---|---|
Gestion centralisée du versioning et du partage des invites au sein de votre organisation avec des capacités de test A/B et l'intégration du Unity Catalog. | |
Intégration d'entreprise | Unity Catalog. Gouvernance unifiée pour tous les assets d'IA avec des fonctionnalités de sécurité d'entreprise, de contrôle d'accès et de conformité. Intelligence des données. Connectez vos données GenAI à vos données métier dans le Lakehouse Databricks et fournissez des analytique personnalisées à vos parties prenantes. Agent Serving. Déployez des agents en production avec mise à l'échelle et rigueur opérationnelle. |