Aller au contenu principal

Feedback humain dans MLflow

MLflow capture les commentaires humains sous forme d'évaluations attachées aux traces de votre application GenAI, vous permettant de recueillir des notes, des commentaires et des attentes de vérité terrain auprès des développeurs, des utilisateurs finaux et des experts du domaine. Le feedback humain complète l'évaluation automatisée. Utilisez-le pour créer des datasets pour les juges et les évaluateurs LLM, et pour les maintenir alignés sur le jugement des experts humains.

Présentation du modèle de données

MLflow stocke les commentaires humains sous forme d'évaluations, attachés à des suivis MLflow individuels. Ceci relie directement les retours à une query utilisateur spécifique et aux sorties et à la logique de votre application GenAI.

Il existe 2 types d'évaluation :

  1. Feedback: Évalue les résultats réels de votre application ou les étapes intermédiaires. Par exemple, il répond à des questions telles que : « La réponse de l'agent était-elle bonne ? » Le feedback évalue ce que l'application a produit, comme les évaluations ou les commentaires. Le feedback évalue ce qui a été généré par l'application et fournit des insights qualitatifs.
  2. L'attente: Définit le résultat souhaité ou correct (vérité terrain) que votre application aurait dû produire . Par exemple, cela pourrait être « La réponse idéale » à la query d'un utilisateur. Pour une entrée donnée, l'attente est toujours la même. Les attentes définissent ce que l'application doit générer et sont utiles pour créer des jeux de données d'évaluation,

Les évaluations peuvent être jointes à la Trace entière ou à un span spécifique au sein de la Trace.

Pour plus de détails sur le traçage, consultez les concepts de la trace.

Comment recueillir des commentaires

MLflow vous aide à recueillir des commentaires provenant de trois sources principales. Chaque source est adaptée à un cas d'utilisation différent dans le cycle de vie de votre application GenAI. Bien que les retours proviennent de différents personas, le modèle de données sous-jacent est le même pour tous les personas.

Commentaires des développeurs

Pendant le développement, vous pouvez annoter directement les traces. C'est utile pour suivre les notes de qualité au fur et à mesure que vous construisez et marquez des exemples spécifiques pour référence future ou pour les tests de régression.

Pour savoir comment annoter les commentaires pendant le développement, consultez Étiqueter pendant le développement.

Commentaires d'experts de domaine

Engagez des experts en la matière pour fournir des commentaires structurés sur les résultats de votre application et définir les attentes en matière de réponses correctes. Leurs évaluations détaillées aident à définir ce à quoi ressemblent les réponses de haute qualité pour votre cas d'utilisation spécifique et sont inestimables pour aligner les juges LLM avec des exigences commerciales nuancées.

Examiner l'image hero de la prévisualisation de l'application.

MLflow propose deux approches pour recueillir les retours d'experts métier à l'aide de l'application Review :

Test interactif avec l'interface de discussion : Les experts interagissent avec votre application déployée en temps réel par le biais d'une interface de discussion, fournissant un retour immédiat sur les réponses lorsqu'ils testent les flux conversationnels. Cette approche est idéale pour les « vérifications d'ambiance » et la validation qualitative avant le déploiement en production. Pour en savoir plus, consultez Testez une version d'application avec l'interface utilisateur de chat.

Étiquetage des traces existantes : Les experts examinent et étiquettent systématiquement les traces qui ont déjà été capturées depuis votre application. Cette approche est idéale pour les sessions d'évaluation structurées où les experts évaluent des exemples spécifiques et définissent les attentes de vérité terrain. Pour en savoir plus, consultez Étiqueter les traces existantes.

Commentaires des utilisateurs finaux

En production, recueillez les commentaires des utilisateurs interagissant avec votre application en direct. Cela fournit des insights cruciaux sur les performances réelles, vous aidant à identifier les requêtes problématiques qui nécessitent une correction et à mettre en évidence les interactions réussies à préserver lors des futures mises à jour. MLflow fournit des outils pour capturer, stocker et analyser les commentaires directement auprès des utilisateurs de vos applications déployées.

Pour savoir comment recueillir les commentaires des utilisateurs finaux, reportez-vous au guide de collecte des commentaires des utilisateurs finaux dans la section traçage.

Ressources supplémentaires