Aller au contenu principal

Tester et surveiller un Genie Agent

Testez un Genie Agent avec des questions réelles, examinez le SQL et les visualisations générés, modifiez les réponses lorsque Genie se trompe, et surveillez l'utilisation de l'agent et les commentaires des utilisateurs afin de maintenir l'exactitude de l'agent à mesure que les données et les questions évoluent. Utilisez des benchmarks pour évaluer la précision des réponses à grande échelle.

remarque

Les agents Genie étaient auparavant appelés Genie space.

Testez votre Genie Agent

La plupart des interactions utilisateur ont lieu dans la fenêtre de chat. La meilleure façon de savoir si votre agent fonctionne comme vous le souhaitez est de le tester avec des questions réalistes que vous vous attendez à ce que vos utilisateurs métier posent.

La fenêtre de chat Genie présentant des exemples de questions et un champ de texte pour saisir votre propre question.

Des exemples de questions configurées dans les paramètres de l'agent apparaissent dans la fenêtre de discussion. Genie peut également générer des exemples de questions basées sur le contexte de l'agent pour aider les utilisateurs à commencer à explorer les données. Les utilisateurs peuvent cliquer sur une question d'exemple ou saisir leurs propres questions dans le champ de texte en bas de l'écran.

Les réponses apparaissent au-dessus du champ de texte. Une fois qu'un utilisateur pose une question, celle-ci est enregistrée dans l'historique de discussion.

Pour start une nouvelle conversation :

  1. Cliquez sur Nouveau chat pour start une nouvelle discussion. Cliquez sur Icône Historique. pour ouvrir une conversation précédente.
  2. Saisissez votre question dans le champ de saisie de texte « Ask your question… » .

Examiner les réponses

Les réponses sont généralement fournies sous forme de réponses en langage naturel aux questions et d'un tableau affichant le jeu de résultats pertinent. Lorsque Genie détecte qu'une visualisation pourrait améliorer la clarté de la réponse, il renvoie également une visualisation. La structure de réponse précise varie en fonction de la question. Si une requête SQL a été générée pour répondre à la question, elle est incluse dans la réponse.

Une réponse exemple avec visualisation, feedback et d'autres options est affichée.

remarque

Comme d’autres grands modèles de langage (LLM), Genie peut présenter des comportements non déterministes. Cela signifie que vous pourriez occasionnellement recevoir des résultats différents en soumettant la même invite plusieurs fois. Fournir des exemples de requêtes SQL à partir desquels Genie peut apprendre peut aider à rendre Genie plus cohérent. Voir Ajouter des exemples de requêtes SQL et de fonctions.

Commentaires sur la réponse

Chaque réponse invite l'utilisateur à répondre : Est-ce exact ? Les utilisateurs peuvent répondre de l'une des manières suivantes :

  • Oui : Confirme que la réponse semble exacte.

  • Corrigez-le : signale la réponse comme incorrecte. Les utilisateurs peuvent choisir parmi les problèmes courants ou saisir leur propre explication. Ils peuvent alors :

    • Cliquez sur Envoyer et réessayer pour régénérer la réponse en utilisant le feedback fourni.
    • Cliquez sur Soumettre pour envoyer les commentaires sans régénérer la réponse.
  • Demander un examen : marque la réponse pour examen manuel. Les utilisateurs peuvent ajouter un commentaire facultatif pour vous fournir un contexte supplémentaire.

En tant qu'éditeur, vous pouvez consulter les commentaires et les réponses signalées dans l'interface Genie. Le comportement de votre Genie Agent ne change pas uniquement en fonction des commentaires de l'utilisateur. Vous devriez utiliser les commentaires pour identifier les opportunités d'amélioration ou répondre directement aux questions des utilisateurs. Databricks recommande d'encourager les utilisateurs à fournir des commentaires sur l'agent en utilisant ce mécanisme.

Les utilisateurs professionnels peuvent consulter les mises à jour des questions qu'ils ont marquées pour examen sur leur page **Moniteur**. Les utilisateurs disposant au minimum de l'autorisation CAN MANAGE sur l'agent Genie Agent peuvent examiner l'échange spécifique, commenter la demande et confirmer ou corriger la réponse. Ils peuvent accéder aux commentaires et examiner les demandes sur la page de monitoring. Vous pouvez ensuite utiliser ces commentaires pour ajuster les réponses et itérer sur votre agent. Consultez Surveiller l'agent.

Autres actions de réponse

Pour les réponses qui incluent du SQL généré, des options supplémentaires vous permettent d'interagir avec les données renvoyées.

  • Copier CSV : Les utilisateurs agents peuvent download jusqu'à environ 1 Go de données de résultats au format CSV. La taille finale du fichier download peut être légèrement supérieure ou inférieure à 1 Go, car la limite de 1 Go est appliquée à une étape antérieure au download final du fichier. Pour télécharger les résultats, cliquez sur l'icône de download dans la réponse.

  • Afficher le code : cliquez sur Afficher le code pour afficher la query générée. Cela peut être utile pour dépanner les réponses peu fiables. Voir Modifier et enregistrer les queries.

  • Le Icône du menu kebab. menu kebab : accédez aux actions suivantes :

    • Copier CSV : Copiez le fichier CSV de la réponse dans votre presse-papiers.
    • Ajouter en tant qu'instruction : pour les interactions qui pourraient être utiles pour apprendre à Genie comment répondre à des questions similaires, cliquez sur Ajouter en tant qu'instruction . Ceci ouvre l’interface utilisateur pour l’enregistrement des exemples de requêtes SQL, avec la question et le SQL généré préremplis. Vous pouvez laisser l’exemple tel quel, ou le modifier et l’enregistrer pour apporter des modifications. Voir Ajouter des exemples de requêtes SQL et de fonctions.
    • Ajouter comme référence : ajoutez la question comme question de référence. Voir Benchmarks.
    • Refresh data : refresh les données en exécutant la query précédemment générée.
    • Régénérer la réponse : soumettez la question à nouveau et demandez à Genie de régénérer la réponse.

Modifier et enregistrer des queries

Les query SQL de Genie peuvent être examinées pour en vérifier l'exactitude et modifiées si nécessaire. Les auteurs de Genie Agent connaissent généralement le domaine et les données qui leur permettent de reconnaître quand Genie génère une réponse incorrecte. Souvent, les erreurs peuvent être corrigées avec une petite quantité d'ajustement manuel à la query SQL générée. Cliquez sur Afficher le code généré pour inspecter la query et afficher le SQL généré pour toute réponse.

Vous pouvez modifier l'instruction SQL générée pour la corriger si vous disposez de privilèges CAN EDIT ou supérieurs sur le Genie Agent. Après avoir effectué vos corrections, exécutez la query. Ensuite, vous pouvez l'enregistrer comme instruction pour apprendre à Genie comment répondre à l'avenir. Pour enregistrer votre query modifiée, cliquez sur Ajouter en tant qu'instruction .

Déboguer les réponses avec Genie Code

Lorsque Genie renvoie une réponse incorrecte, utilisez Genie Code pour diagnostiquer le problème et améliorer le contexte de l'agent :

  1. Ouvrez Genie Code à partir de la réponse.
  2. Décrivez le problème et le comportement que vous souhaitez.
  3. Examinez les modifications de contexte que Genie Code propose, et acceptez celles que vous souhaitez conserver.
prompt

Demandez à Genie Code de le faire pour vous :

The Genie Agent is using calendar quarters instead of our fiscal calendar. Update its context to use our fiscal quarters: Q1 is February through April, Q2 is May through July, Q3 is August through October, and Q4 is November through January.

Vous pouvez également utiliser Genie Code pour enregistrer le contexte sémantique d'une conversation. Une fois que les utilisateurs ont introduit de nouveaux termes ou corrigé le comportement de Genie, demandez à Genie Code de capturer ce qu’il a appris. Passez en revue chaque suggestion et acceptez le contexte que vous souhaitez ajouter à l’agent.

Surveillez l'agent

Un agent Genie Agent peut être considéré comme un outil de collaboration à long terme entre les équipes de données et les utilisateurs métier. Il accumule des connaissances au fil du temps plutôt que de servir de déploiement ponctuel. Lorsque les utilisateurs posent de nouvelles questions, vous pouvez affiner l'agent pour améliorer la couverture et la précision.

Utilisez l'onglet Monitor pour examiner les questions et réponses individuelles, afficher les commentaires des utilisateurs et identifier les réponses signalées pour examen.

Le tab Moniteur affichant une liste de questions et de réponses avec des filtres pour l'heure, l'évaluation, l'utilisateur et le statut.

Le tab Moniteur affiche toutes les questions et réponses qui ont été posées à l'agent. Vous pouvez filtrer les questions par heure, note, utilisateur ou statut. En monitoring l'agent, les utilisateurs disposant des autorisations CAN MANAGE peuvent comprendre de manière proactive les requêtes émises par les utilisateurs métier et la manière dont le Genie Agent y a répondu.

L'identification des questions avec lesquelles Genie a des difficultés peut vous aider à mettre à jour l'agent Genie avec des instructions spécifiques pour améliorer ses réponses. Cliquez sur une question pour ouvrir le texte de la question et de la réponse et afficher l'intégralité du fil de discussion du chat.

Examiner l'utilisation et les tendances

Utilisez la section Digest hebdomadaire de l’onglet tab pour consulter le volume de messages hebdomadaire, les utilisateurs actifs et les retours positifs/négatifs. Pour identifier les principales tendances d'utilisation et les problèmes courants, cliquez sur Analyser l'utilisation de l'espace . Cela lance Genie Code, qui passe en revue les messages des utilisateurs, les commentaires et les problèmes des sept derniers jours, et rend compte des sujets courants, des problèmes récurrents et des améliorations de contexte suggérées. Les réponses incluent des citations qui renvoient aux conversations pertinentes de votre agent. Cliquez sur une citation pour ouvrir la conversation directement dans le fil de discussion Genie Code.

La section « Digest hebdomadaire » de l'onglet Monitoring affichant les messages, les utilisateurs et les commentaires hebdomadaires.

Examiner les conversations pour la qualité

info

Bêta

Cette fonctionnalité est en Bêta. Pour l'utiliser, un administrateur du Workspace doit activer **Genie Chat Sharing** à partir de la page **Prévisualisations**. Voir Gérer les aperçus Databricks.

**Genie Chat Sharing** permet aux gestionnaires d'agents d'examiner les conversations complètes que les utilisateurs professionnels ont avec un Genie Agent. Lorsqu'une conversation est définie sur **Examinable par les gestionnaires d'espaces**, les utilisateurs disposant de l'autorisation CAN MANAGE peuvent ouvrir la conversation depuis l'onglet monitoring pour examiner l'échange complet. Ceci vous permet d'évaluer la qualité de réponse de Genie, de répondre aux retours d'utilisateurs et d'identifier les domaines où des instructions supplémentaires ou des queries d'exemple amélioreraient la précision. Pour les conversations définies sur Privé , les gestionnaires d'agents peuvent voir les invites des utilisateurs dans la tab monitoring, mais ne peuvent pas afficher l'intégralité de la conversation ni les résultats. Pour plus d'informations, consultez Partager une conversation.

remarque

Les conversations créées avant l'activation de la version Beta restent **privées**. Les conversations créées après son activation sont default à vérifiables par les gestionnaires d’espace .

Supprimer une conversation

Les utilisateurs disposant de l'autorisation CAN MANAGE sur un Genie Agent peuvent supprimer définitivement toute conversation dans l'agent depuis la page de monitoring. Ceci supprime la conversation et ses messages pour tous les utilisateurs.

  1. Ouvrez le Genie Agent et cliquez sur l'onglet tab .
  2. Cliquez sur une conversation pour ouvrir le panneau de conversation.
  3. Cliquez sur Supprimer la conversation .
  4. Dans la boîte de dialogue de confirmation, cliquez sur Supprimer pour supprimer définitivement la conversation, ou sur Annuler pour fermer la boîte de dialogue sans supprimer.

Benchmarks

Les benchmarks vous permettent de créer un ensemble de questions de test que vous pouvez exécuter pour évaluer la précision globale des réponses de Genie. Un ensemble de points de référence bien conçu couvrant les questions d'utilisateur les plus fréquemment posées permet d’évaluer la précision de votre Genie Agent à mesure que vous l'affinez. Chaque Genie Agent peut contenir jusqu'à 500 questions de benchmark.

Les questions de benchmark s'exécutent comme de nouvelles conversations. Elles n'ont pas le même contexte qu'une conversation Genie filaire. Chaque question est traitée comme une nouvelle query, en utilisant les instructions définies dans l'agent, y compris tout exemple SQL et toute fonction SQL fournis.

Les questions de benchmark supportent deux modes :

  • Mode discussion : Le mode default. Genie évalue la précision en comparant ses résultats générés par SQL à une réponse SQL fournie.
  • Mode Agent : Exécute les questions de benchmark en utilisant le même raisonnement multi-étapes que le mode Agent de Genie. Un juge LLM évalue les réponses. Vous pouvez fournir une note d'évaluation facultative pour guider la notation.

Exemples de benchmarks avec une précision rapportée sur neuf questions.

Ajoutez des questions de référence

Les questions de benchmark doivent refléter différentes façons de formuler les questions courantes que vos utilisateurs posent. Vous pouvez les utiliser pour vérifier la réponse de Genie aux variations de formulation des questions ou aux différents formats de questions.

Lorsque vous créez une question de benchmark, vous pouvez éventuellement inclure une requête SQL dont le jeu de résultats est la réponse correcte. Pendant les exécutions de benchmarks, la précision est évaluée en comparant le jeu de résultats de votre query SQL à celui généré par Genie. Vous pouvez également utiliser les fonctions SQL de Unity Catalog comme réponses gold standard pour les benchmarks.

Pour ajouter une question de référence :

  1. Près du haut du Genie Agent, cliquez sur Référence .

  2. Cliquez sur Ajouter un benchmark .

  3. Dans le champ Question , saisissez une question de référence à tester.

  4. Sélectionnez un mode : Chat ou Agent .

    • Mode Chat : Genie évalue la précision en comparant ses résultats à une réponse SQL que vous fournissez.
    • Mode Agent : Genie utilise un raisonnement en plusieurs étapes pour répondre à la question. Un juge LLM évalue les réponses.
  5. (Mode conversation uniquement) Fournissez une requête SQL qui répond à la question. Vous pouvez écrire votre propre query en tapant dans la zone **SQL Answer**, y compris les fonctions SQL du Unity Catalog. Sinon, cliquez sur Générer une requête SQL pour que Genie rédige la requête SQL pour vous. Utilisez une instruction SQL qui répond précisément à la question que vous avez saisie.

remarque

Cette étape est recommandée. Seules les questions qui incluent cet exemple d'instruction SQL peuvent être évaluées automatiquement pour leur exactitude. Toute question qui n'inclut pas de Réponse SQL nécessite un examen manuel pour être notée. Si vous utilisez le bouton Générer SQL , examinez l'instruction pour vous assurer qu'elle répond avec précision à la question.

  1. (Mode Agent uniquement, facultatif) Dans le champ Note d'évaluation , saisissez des indications sur la bonne réponse ou le contenu attendu. Genie transmet la note d’évaluation au juge LLM. La note peut faire référence au contenu attendu dans les rapports texte générés par le mode Agent.

  2. (Mode de discussion uniquement, facultatif) Cliquez sur **Exécuter** pour exécuter votre query et afficher les résultats.

  3. Lorsque vous avez terminé la modification, cliquez sur Ajouter un benchmark .

  4. Pour mettre à jour une question après l'enregistrement, cliquez sur l'Icône de modification icône du crayon pour ouvrir la boîte de dialogue Mettre à jour la question .

Utilisez les benchmarks pour tester différents libellés de question.

Lors de l'évaluation de la précision de votre Genie Agent, il est important de structurer les tests pour refléter des scénarios réalistes. Les utilisateurs peuvent poser la même question de différentes manières. Databricks recommande d'ajouter plusieurs formulations de la même question et d'utiliser le même exemple SQL dans vos tests de référence pour évaluer pleinement la précision. La plupart des Genie Agents doivent inclure entre deux et quatre formulations de la même question.

Exécuter les questions de benchmark

Les utilisateurs disposant au moins des autorisations CAN EDIT dans un Genie Agent peuvent exécuter une évaluation de référence à tout moment. Vous pouvez exécuter toutes les questions de référence ou sélectionner un sous-ensemble de questions à tester.

Pour chaque question, Genie interprète l'entrée, génère du SQL et renvoie les résultats. Le SQL et les résultats générés sont ensuite comparés à la **SQL Answer** définie dans la question de benchmark.

Pour exécuter toutes les questions de benchmark :

  1. Près du haut du Genie Agent, cliquez sur Référence .
  2. Cliquez sur Exécuter les benchmarks pour start l'exécution du test.

Pour exécuter un sous-ensemble de questions de benchmark :

  1. Près du haut du Genie Agent, cliquez sur Référence .
  2. Cochez les cases à côté des questions que vous souhaitez tester.
  3. Cliquez sur Exécuter la sélection pour start l'exécution de test sur les questions sélectionnées.

Vous pouvez également sélectionner un sous-ensemble de questions d'un résultat de benchmark précédent et réexécuter ces questions spécifiques pour tester des améliorations.

Les benchmarks continuent de s'exécuter lorsque vous quittez la page. Vous pouvez consulter les résultats dans l'onglet tab une fois l'exécution terminée.

Une fois l'exécution terminée, vous pouvez utiliser Genie Code pour examiner les résultats de l'ensemble de l'exécution et suggérer des améliorations de contexte. Consultez Analyser une exécution de benchmark avec Genie Code.

Évaluations du mode conversationnel

Les critères suivants déterminent comment Genie évalue les réponses en mode conversation :

État

Notation

Genie génère du SQL qui correspond exactement à la réponse SQL fournie

Bien

Genie génère un jeu de résultats qui correspond exactement à celui produit par la réponse SQL

Bien

Genie génère un jeu de résultats avec les mêmes données que la réponse SQL , mais triées différemment.

Bien

Genie génère un jeu de résultats avec des valeurs numériques qui sont arrondies aux 4 chiffres significatifs identiques à la réponse SQL

Bien

Genie génère du SQL qui produit un jeu de résultats vide ou renvoie une erreur.

Mauvais

Genie génère un jeu de résultats qui inclut des colonnes supplémentaires par rapport au jeu de résultats produit par la Réponse SQL

Mauvais

Genie génère un résultat de cellule unique différent du résultat de cellule unique produit par la **Réponse SQL**

Mauvais

État

Notation

Genie génère du SQL qui correspond exactement à la réponse SQL fournie

Bien

Genie génère un jeu de résultats qui correspond exactement à celui produit par la réponse SQL

Bien

Genie génère un jeu de résultats avec les mêmes données que la réponse SQL , mais triées différemment.

Bien

Genie génère un jeu de résultats avec des valeurs numériques qui sont arrondies aux 4 chiffres significatifs identiques à la réponse SQL

Bien

Genie génère du SQL qui produit un jeu de résultats vide ou renvoie une erreur.

Mauvais

Genie génère un jeu de résultats qui inclut des colonnes supplémentaires par rapport au jeu de résultats produit par la Réponse SQL

Mauvais

Genie génère un résultat de cellule unique différent du résultat de cellule unique produit par la **Réponse SQL**

Mauvais

Vérification manuelle requise : Les réponses sont marquées de cette étiquette lorsque Genie ne peut pas évaluer la justesse ou lorsque les résultats de requête générés par Genie ne contiennent pas de correspondance exacte avec les résultats de la réponse SQL fournie. Toutes les questions de référence qui n'incluent pas de réponse SQL doivent être examinées manuellement.

Évaluations du mode Agent

Un juge LLM évalue les réponses en mode Agent plutôt que d'utiliser la comparaison SQL. Si vous avez fourni une note d’évaluation , le juge LLM l’utilise comme guide lors de l’évaluation de la réponse, y compris tout contenu attendu dans le rapport texte généré par le mode Agent. Le juge évalue comme Bonnes les réponses qui satisfont aux critères des notes d'évaluation.

Accéder aux évaluations de référence

Vous pouvez accéder à toutes vos évaluations de référence pour suivre la précision de votre Genie Agent au fil du temps. Lorsque vous ouvrez les Benchmarks d'un agent, une liste Timestamp des exécutions d'évaluation apparaît dans l'onglet Évaluations. Si aucune exécution d'évaluation n'est trouvée, consultez Ajouter des questions de référence ou Exécuter des questions de référence.

Écran des évaluations tel que décrit dans le texte qui suit.

Le **Evaluations** tab affiche un aperçu des évaluations et de leurs performances signalées dans les catégories :

Nom de l'évaluation : un Timestamp qui indique le moment où une exécution d'évaluation a eu lieu. Cliquez sur le Timestamp pour voir les détails de cette évaluation. Statut d'exécution : indique si l'évaluation est terminée, interrompue ou infructueuse. Si une exécution d'évaluation inclut des questions de référence qui n'ont pas de réponses SQL prédéfinies, elle est marquée pour révision dans cette colonne. Précision : une évaluation numérique de la précision sur toutes les questions de benchmark. Pour les exécutions d'évaluation qui nécessitent une révision manuelle, une mesure de précision apparaît seulement après que ces questions ont été examinées. Créé par : indique le nom de l'utilisateur qui a exécuté l'évaluation.

Examiner les évaluations individuelles

Vous pouvez examiner les évaluations individuelles pour obtenir un aperçu détaillé de chaque réponse. Vous pouvez modifier l'évaluation pour toute question et mettre à jour les éléments qui nécessitent une révision manuelle.

Pour examiner les évaluations individuelles :

  1. En haut de la page Genie Agent, cliquez sur Benchmark .

  2. Cliquez sur le Timestamp pour toute évaluation dans la colonne Nom de l'évaluation pour ouvrir une vue détaillée de cette exécution de test.

    Un écran qui affiche les résultats d'une seule exécution d'évaluation. Toutes les questions sont listées à gauche. Le cas échéant, les questions individuelles sont affichées à droite avec la sortie du modèle et la sortie de la vérité terrain.

  3. Utilisez la liste de questions sur le côté gauche de l'écran pour afficher une vue détaillée de chaque question.

  4. Examinez et comparez la réponse Sortie du modèle avec la réponse Vérité terrain .

    Pour les résultats jugés incorrects, une explication apparaît décrivant pourquoi le résultat a été jugé mauvais . Cela vous aide à comprendre les différences spécifiques entre la sortie générée et la vérité terrain attendue.

remarque

Les résultats de ces réponses apparaissent dans les détails de l'évaluation pendant une semaine. Après une semaine, les résultats ne sont plus visibles. L'instruction SQL générée et l'exemple d'instruction SQL restent.

  1. Cliquez sur Mettre à jour la vérité terrain pour enregistrer la réponse comme nouvelle vérité terrain pour cette question. C'est utile si aucune vérité terrain n'existe, ou si la réponse est meilleure ou plus précise que l'énoncé de vérité terrain existant.

  2. Cliquez sur Icône de modification sur l’étiquette pour modifier l’évaluation.

    Marquez chaque résultat comme Bon ou Mauvais pour obtenir un score précis pour cette évaluation.

Analyser une exécution de benchmark avec Genie Code

Une fois l'exécution du benchmark terminée, utilisez Genie Code pour examiner les résultats de l'ensemble de l'exécution au lieu d'inspecter chaque question individuellement. Lancez Genie Code depuis l'évaluation et demandez-lui d'analyser l'exécution. Genie Code examine les résultats attendus, ce que votre agent a généré et le contexte actuel de l'agent pour identifier les lacunes, puis suggère des améliorations d'instructions et de contexte que vous pourrez examiner et enregistrer.