Aller au contenu principal

Exécutions d’évaluation dans MLflow

Les exécutions d'évaluation sont des exécutions MLflow qui organisent et stockent les résultats de l'évaluation de votre application GenAI. Une exécution d'évaluation comprend les éléments suivants :

  • Traces : une trace pour chaque entrée de votre dataset d'évaluation.
  • Commentaires : Évaluations de la qualité des évaluateurs associées à chaque trace.
  • Mesures : Statistiques agrégées sur tous les exemples évalués.
  • Métadonnées : Informations sur la configuration de l’évaluation.

Comment créer des exécutions d'évaluation

Une exécution d'évaluation est automatiquement créée lorsque vous appelez mlflow.genai.evaluate(). Pour plus d'informations sur mlflow.genai.evaluate(), consultez le code source MLflow et la documentation.

Python
import mlflow

# This creates an evaluation run
results = mlflow.genai.evaluate(
data=test_dataset,
predict_fn=my_app,
scorers=[correctness_scorer, safety_scorer],
experiment_name="my_app_evaluations"
)

# Access the run ID
print(f"Evaluation run ID: {results.run_id}")

Structure d'exécution de l'évaluation

Evaluation Run
├── Run Info
│ ├── run_id: unique identifier
│ ├── experiment_id: which experiment it belongs to
│ ├── start_time: when evaluation began
│ └── status: success/failed
├── Traces (one per dataset row)
│ ├── Trace 1
│ │ ├── inputs: {"question": "What is MLflow?"}
│ │ ├── outputs: {"response": "MLflow is..."}
│ │ └── feedbacks: [correctness: 0.8, relevance: 1.0]
│ ├── Trace 2
│ └── ...
├── Aggregate Metrics
│ ├── correctness_mean: 0.85
│ ├── relevance_mean: 0.92
│ └── safety_pass_rate: 1.0
└── Parameters
├── model_version: "v2.1"
├── dataset_name: "qa_test_v1"
└── scorers: ["correctness", "relevance", "safety"]