Aller au contenu principal

Évaluer et améliorer

astuce

Démarrage rapide de l’agent de codage

Utilisez-vous un agent de codage ? Collez ce prompt :

Read the documentation at https://docs.databricks.com/aws/en/mlflow3/genai/eval-monitor and set up evaluation for my agent using scorers and an evaluation dataset.

Vous pouvez également installer mlflow/skills pour une intégration plus approfondie avec MLflow.

L’évaluation permet de déterminer si votre agent est réellement performant : la réponse est-elle correcte, étayée, sûre et complète ? MLflow évalue vos traces à l’aide d’ évaluateurs : des juges LLM et des vérifications basées sur du code qui associent une évaluation de la qualité à chaque trace. Start par évaluer quelques traces à partir de l’interface utilisateur, puis intégrez ces mêmes évaluateurs dans une boucle mlflow.genai.evaluate() reproductible à mesure que votre application gagne en maturité.

Aperçu rapide : évaluer les traces à partir de l’interface utilisateur

Évaluez les traces que vous possédez déjà, sans code :

  1. Dans l’onglet Traces , sélectionnez quelques traces à l’aide des cases à cocher des lignes.

  2. Cliquez sur Actions et choisissez Évaluer .

    Sélectionnez des traces, puis choisissez Actions et Évaluer.

  3. Dans la boîte de dialogue Run scorer , choisissez un ou plusieurs évaluateurs : faites votre choix parmi les évaluateurs Pre-built LLM-as-a-judge (tels que Correctness, Completeness et Fluency), réutilisez l'un de vos Registered scorers ou cliquez sur Create scorer .

    Boîte de dialogue de l'évaluateur répertoriant les évaluateurs LLM-as-a-judge préconfigurés.

  4. Cliquez sur Run scorer . MLflow exécute les évaluateurs sur les traces sélectionnées, associe chaque résultat à sa trace sous forme de commentaire et enregistre l'exécution sous l'onglet Evaluation runs tab.

Il s'agit de la même évaluation qui alimente l'évaluation programmatique — les juges que vous choisissez ici sont les juges LLM intégrés, et les résultats sont enregistrés sous forme de traces avec les commentaires des évaluateurs dans votre Experiment.

Étapes suivantes