Aller au contenu principal

MLflow 3 pour GenAI

MLflow 3 pour la GenAI est une plateforme ouverte qui unifie le suivi, l'évaluation et l'observabilité des applications et agents GenAI tout au long du cycle de vie du développement et de la production. Il inclut la journalisation des traces en temps réel, des scorers intégrés et personnalisés, l'intégration des commentaires humains et le suivi des versions pour vous aider à évaluer et à améliorer efficacement la qualité des applications pendant le développement et à continuer de suivre et d'améliorer la qualité en production.

Managed MLflow sur Databricks étend MLflow open source avec des capacités conçues pour les applications GenAI de production, y compris une gouvernance prête pour l'entreprise, un hébergement entièrement managé, une mise à l'échelle au niveau de la production et une intégration avec vos données dans le lakehouse Databricks et Unity Catalog.

Pour des informations sur l'évaluation des agents dans MLflow 2, consultez Agent Evaluation (MLflow 2) et le guide de migration. Pour MLflow 3, les méthodes du SDK d'Agent Evaluation ont été intégrées à MLflow géré par Databricks.

Pour une série de tutoriels pour vous aider à start, see start.

Comment MLflow 3 aide à optimiser la qualité des applications GenAI

L'évaluation des applications et des agents GenAI est plus complexe que l'évaluation des logiciels traditionnels. Les entrées et les sorties sont souvent du texte libre, et de nombreuses sorties différentes peuvent être considérées comme correctes. La qualité dépend non seulement de l'exactitude, mais aussi de facteurs tels que la précision, la longueur, l'exhaustivité, la pertinence et d'autres critères spécifiques au cas d'utilisation. Étant donné que les LLM sont intrinsèquement non déterministes et que les agents GenAI incluent des composants supplémentaires tels que des récupérateurs et des outils, leurs réponses peuvent varier d'une exécution à l'autre.

Les développeurs ont besoin de métriques de qualité concrètes, d'une évaluation automatisée et d'un monitoring continu pour créer et déployer des applications d'IA robustes. MLflow 3 pour GenAI fournit ces éléments clés pour un développement, un déploiement et une amélioration continue efficaces :

En utilisant MLflow 3 sur Databricks, vous pouvez rapprocher l’IA de vos données afin de vous aider à comprendre en profondeur et à améliorer la qualité. Unity Catalog assure une gouvernance cohérente pour les invites, les applications et les traces. Avec n'importe quel modèle ou framework, MLflow vous accompagne tout au long du cycle de développement, jusqu'à et en production.

Get start

Start building better GenAI applications with comprehensive observability and evaluation tools.

Tâche

Description

Guide de start rapide

Soyez opérationnel en quelques minutes grâce à des instructions étape par étape pour instrumenter votre première application avec le traçage, exécuter l'évaluation et recueillir les commentaires humains.

Bien démarrer : MLflow Tracing pour GenAI (Databricks Notebook)

Instrumentez une application GenAI simple pour capturer automatiquement des traces détaillées pour le debugging et l'optimisation.

Tutoriel : Évaluer et améliorer une application GenAI

Vous accompagne dans l'évaluation d'une application de génération d'e-mails qui utilise la Génération augmentée de récupération (RAG).

Démo de 10 minutes : Recueillir le feedback humain

Collectez les retours des utilisateurs finaux, ajoutez des annotations de développeur, créez des sessions d'évaluation par des experts, et utilisez ces retours pour évaluer la qualité de votre application GenAI.

Tâche

Description

Guide de start rapide

Soyez opérationnel en quelques minutes grâce à des instructions étape par étape pour instrumenter votre première application avec le traçage, exécuter l'évaluation et recueillir les commentaires humains.

Bien démarrer : MLflow Tracing pour GenAI (Databricks Notebook)

Instrumentez une application GenAI simple pour capturer automatiquement des traces détaillées pour le debugging et l'optimisation.

Tutoriel : Évaluer et améliorer une application GenAI

Vous accompagne dans l'évaluation d'une application de génération d'e-mails qui utilise la Génération augmentée de récupération (RAG).

Démo de 10 minutes : Recueillir le feedback humain

Collectez les retours des utilisateurs finaux, ajoutez des annotations de développeur, créez des sessions d'évaluation par des experts, et utilisez ces retours pour évaluer la qualité de votre application GenAI.

Traçage

MLflow Tracing assure l’observabilité et consigne les données de trace nécessaires à l’évaluation et au monitoring.

Fonctionnalité

Description

MLflow Tracing

Observabilité de bout en bout pour les applications GenAI, y compris les systèmes complexes basés sur des agents. Suivez les entrées, les sorties, les étapes intermédiaires et les métadonnées pour une vue d'ensemble complète de la façon dont votre application se comporte.

Qu'est-ce que le traçage ?

Introduction aux concepts de traçage.

Passez en revue le comportement et les performances de votre application.

Une visibilité complète de l'exécution vous permet de capturer les invites, les récupérations, les appels d'outils, les réponses, la latence et les coûts.

Observabilité en production

Utilisez la même instrumentation dans les environnements de développement et de production pour une évaluation cohérente.

Construire des datasets d'évaluation

Analysez les traces pour identifier les problèmes de qualité, sélectionnez les traces représentatives, créez des jeux de données d'évaluation et améliorez systématiquement votre application.

Intégrations de traçage

MLflow Tracing est intégré à de nombreuses bibliothèques et frameworks pour un traçage automatique qui vous permet d’obtenir une observabilité immédiate de vos applications GenAI avec une configuration minimale.

Genie Code pour l'observabilité et l'évaluation des agents

Utilisez le langage naturel pour analyser les traces, déboguer les erreurs, examiner les résultats d'évaluation, inspecter les évaluateurs et obtenir des conseils d'instrumentation — directement au sein de votre expérimentation.

Fonctionnalité

Description

MLflow Tracing

Observabilité de bout en bout pour les applications GenAI, y compris les systèmes complexes basés sur des agents. Suivez les entrées, les sorties, les étapes intermédiaires et les métadonnées pour une vue d'ensemble complète de la façon dont votre application se comporte.

Qu'est-ce que le traçage ?

Introduction aux concepts de traçage.

Passez en revue le comportement et les performances de votre application.

Une visibilité complète de l'exécution vous permet de capturer les invites, les récupérations, les appels d'outils, les réponses, la latence et les coûts.

Observabilité en production

Utilisez la même instrumentation dans les environnements de développement et de production pour une évaluation cohérente.

Construire des datasets d'évaluation

Analysez les traces pour identifier les problèmes de qualité, sélectionnez les traces représentatives, créez des jeux de données d'évaluation et améliorez systématiquement votre application.

Intégrations de traçage

MLflow Tracing est intégré à de nombreuses bibliothèques et frameworks pour un traçage automatique qui vous permet d’obtenir une observabilité immédiate de vos applications GenAI avec une configuration minimale.

Genie Code pour l'observabilité et l'évaluation des agents

Utilisez le langage naturel pour analyser les traces, déboguer les erreurs, examiner les résultats d'évaluation, inspecter les évaluateurs et obtenir des conseils d'instrumentation — directement au sein de votre expérimentation.

Évaluation et monitoring

Remplacez les tests manuels par une évaluation automatisée à l'aide de juges LLM et de scorers intégrés et personnalisés qui correspondent à l'expertise humaine et peuvent être appliqués en développement et en production. Chaque interaction de production devient une occasion de s'améliorer grâce à des commentaires intégrés et des workflows d'évaluation.

Fonctionnalité

Description

Évaluer et superviser les agents GenAI

Présentation de l’évaluation et du monitoring des agents à l’aide de MLflow 3 sur Databricks.

Juges et évaluateurs LLM

MLflow 3 inclut des juges LLM intégrés pour la sécurité, la pertinence, l’exactitude, la qualité de récupération et plus encore. Vous pouvez également créer des juges LLM personnalisés et des évaluateurs basés sur du code pour répondre à vos besoins métier spécifiques.

Évaluation

Exécutez l'évaluation pendant le développement ou dans le cadre d'un processus de publication.

Monitoring de la production

Surveillez en continu un échantillon du trafic de production à l'aide de juges et d'évaluateurs LLM.

Collecter les feedback humain

Recueillez et utilisez les commentaires des experts du domaine et des utilisateurs finaux pendant le développement et la production pour une amélioration continue.

Genie Code pour l'observabilité et l'évaluation des agents

Demandez à Genie Code de revoir les scores d’évaluation, d’inspecter les datasets d’évaluation, de vérifier les configurations du marqueur et d’aider à configurer l’évaluation de votre agent à l’aide du langage naturel.

Fonctionnalité

Description

Évaluer et superviser les agents GenAI

Présentation de l’évaluation et du monitoring des agents à l’aide de MLflow 3 sur Databricks.

Juges et évaluateurs LLM

MLflow 3 inclut des juges LLM intégrés pour la sécurité, la pertinence, l’exactitude, la qualité de récupération et plus encore. Vous pouvez également créer des juges LLM personnalisés et des évaluateurs basés sur du code pour répondre à vos besoins métier spécifiques.

Évaluation

Exécutez l'évaluation pendant le développement ou dans le cadre d'un processus de publication.

Monitoring de la production

Surveillez en continu un échantillon du trafic de production à l'aide de juges et d'évaluateurs LLM.

Collecter les feedback humain

Recueillez et utilisez les commentaires des experts du domaine et des utilisateurs finaux pendant le développement et la production pour une amélioration continue.

Genie Code pour l'observabilité et l'évaluation des agents

Demandez à Genie Code de revoir les scores d’évaluation, d’inspecter les datasets d’évaluation, de vérifier les configurations du marqueur et d’aider à configurer l’évaluation de votre agent à l’aide du langage naturel.

Gérer le cycle de vie des applications GenAI

Versionnez, suivez et gouvernez votre application GenAI complète avec des outils de gestion du cycle de vie et de gouvernance de niveau entreprise.

Fonctionnalité

Description

Registre des invites.

Gestion centralisée du versioning et du partage des invites au sein de votre organisation avec des capacités de test A/B et l'intégration du Unity Catalog.

Intégration d'entreprise

Unity Catalog. Gouvernance unifiée pour tous les assets d'IA avec des fonctionnalités de sécurité d'entreprise, de contrôle d'accès et de conformité.

Intelligence des données. Connectez vos données GenAI à vos données métier dans le Lakehouse Databricks et fournissez des analytique personnalisées à vos parties prenantes.

Agent Serving. Déployez des agents en production avec mise à l'échelle et rigueur opérationnelle.

Fonctionnalité

Description

Registre des invites.

Gestion centralisée du versioning et du partage des invites au sein de votre organisation avec des capacités de test A/B et l'intégration du Unity Catalog.

Intégration d'entreprise

Unity Catalog. Gouvernance unifiée pour tous les assets d'IA avec des fonctionnalités de sécurité d'entreprise, de contrôle d'accès et de conformité.

Intelligence des données. Connectez vos données GenAI à vos données métier dans le Lakehouse Databricks et fournissez des analytique personnalisées à vos parties prenantes.

Agent Serving. Déployez des agents en production avec mise à l'échelle et rigueur opérationnelle.