Tester une version d'application avec l'interface utilisateur de Chat de l'application d'évaluation
L'application MLflow Review inclut une interface de chat intégrée qui permet aux experts du domaine de tester interactivement votre application GenAI et de fournir un feedback immédiat. Utilisez l'interface de discussion pour tester votre application.
L’interface utilisateur de discussion de l’application d’examen nécessite un agent déployé sur un Endpoint Model Serving. Il ne prend actuellement pas en charge les agents déployés sur Databricks Apps. Si vous déployez votre agent sur Databricks Apps, vous pouvez toujours étiqueter les traces existantes pour évaluation. Databricks intègre la prise en charge des révisions et des commentaires directement dans le template de chatbot.

Quand utiliser les tests d'interface utilisateur de chat
Le test de l'interface utilisateur de chat est idéal lorsque vous souhaitez :
- Testez les flux conversationnels et les interactions multi-tours avec des experts du domaine.
- Recueillir l'avis d'experts sur les réponses et le comportement des applications.
- Valider les mises à jour dans un environnement sécurisé avant le déploiement en production.
Prérequis
-
MLflow et les packages requis doivent être installés. Les fonctionnalités décrites dans ce guide nécessitent MLflow version 3.1.0 ou au-dessus. Exécutez la commande suivante pour installer ou mettre à niveau le SDK MLflow, y compris les modules complémentaires nécessaires à l'intégration de Databricks :
Bashpip install --upgrade "mlflow[databricks]>=3.1.0" openai "databricks-connect>=16.1" -
Votre environnement de développement doit être connecté à l’ Expérimentation MLflow où sont enregistrées les traces de votre application GenAI.
- Suivez Didacticiel : Connecter votre environnement de développement à MLflow pour connecter votre environnement de développement.
-
Les experts du domaine doivent disposer des permissions suivantes pour utiliser l'interface utilisateur de chat de l'application d'évaluation :
-
Accès au compte : Doit être provisionné dans votre compte Databricks, mais ne nécessite pas d'accès à votre workspace.
Pour les utilisateurs sans accès au workspace, les administrateurs de compte peuvent :
- Utilisez le provisionnement SCIM au niveau du compte pour synchroniser les utilisateurs depuis votre fournisseur d'identité
- Enregistrer manuellement les utilisateurs et les groupes dans Databricks.
Consultez la gestion des utilisateurs et des groupes pour plus de détails.
-
Accès à l'Endpoint : permission CAN_QUERY pour l'Endpoint de service de modèle.
-
Configurez et recueillez des commentaires avec l’interface utilisateur de chat
L'interface utilisateur de chat de l'application de révision MLflow se connecte à une version déployée de votre application GenAI, permettant aux experts du domaine de discuter avec votre application et de fournir des commentaires immédiats. Suivez ces étapes pour configurer l'interface utilisateur du Chat et collecter les commentaires :
-
Packagez votre application à l'aide de Custom Agents et déployez-la à l'aide de Deploy on Apps en tant qu'endpoint Model Serving.
-
Ajoutez l'endpoint à l'application de révision de votre experimentation :
L’exemple ci-dessous ajoute un LLM hébergé sur Databricks à l’application d’évaluation. Remplacez l’endpoint par l’endpoint de votre application de l’étape 1.
from mlflow.genai.labeling import get_review_app
# Get review app for current MLflow experiment
review_app = get_review_app()
# Connect your deployed agent endpoint
review_app.add_agent(
agent_name="claude-sonnet",
model_serving_endpoint="databricks-claude-sonnet-4-5",
)
print(f"Share this URL: {review_app.url}/chat")
- Une fois configurée, partagez l'URL de l'application de révision avec vos experts du domaine. Ils pourront :
- Accédez à l'interface de discussion via votre navigateur web.
- Interagissez avec votre application en tapant des questions
- Fournissez des retours après chaque réponse à l'aide des contrôles de feedback intégrés.
- Continuez la conversation pour tester plusieurs interactions.
Rendu du contenu de l'application de révision
L'interface utilisateur de chat utilise des queries d'experts du domaine en entrée, des réponses d'endpoint d'agent en direct en sortie, et stocke les résultats dans des traces MLflow. Vous n'avez pas besoin de fournir un schéma d'étiquetage personnalisé, car cette approche utilise des questions de feedback fixes.
L'application Review rend automatiquement différents types de contenu à partir de votre trace MLflow :
-
Documents récupérés : les documents d'une
RETRIEVERétendue sont affichés. -
Messages au format OpenAI : Les entrées et les sorties du suivi MLflow suite aux conversations de chat OpenAI sont affichés :
outputsqui contiennent un objet ChatCompletions au format OpenAIinputsououtputsdictionnaires qui contiennent une clémessagesavec un tableau de messages de chat au format OpenAI- Si le tableau
messagescontient des appels d'outils au format OpenAI, ils sont également affichés
- Si le tableau
-
Dictionnaires : les entrées et les sorties de la MLflow Trace qui sont des dictionnaires sont rendues sous forme de JSON jolis.
Sinon, le contenu des input et output de l'étendue racine de chaque trace est utilisé comme contenu principal pour la révision.
Afficher les commentaires de chat
Toutes les interactions et les retours recueillis via l'interface utilisateur de chat sont automatiquement capturées en tant que traces dans MLflow.
Pour afficher les traces des interactions de chat :
- Accéder à l'interface utilisateur MLflow
- Recherchez l’expérimentation associée à votre session Review App
- Parcourez les traces pour voir l'historique complet de la conversation
- Examiner les commentaires attachés à chaque réponse
Étapes suivantes
- Découvrez comment étiqueter les traces existantes pour une collecte de commentaires plus systématique.
- Explorez la collecte des retours d'utilisateurs finaux pour les applications de production.