Migrer vers MLflow 3 à partir d'Agent Evaluation : référence rapide
Cette référence rapide récapitule les changements clés pour la migration d'Agent Evaluation et MLflow 2 vers les APIs améliorées de MLflow 3. Consultez le guide complet à l'adresse Migrer vers MLflow 3 depuis Agent Evaluation.
Mises à jour des importations
### Old imports ###
from mlflow import evaluate
from databricks.agents.evals import metric
from databricks.agents.evals import judges
from databricks.agents import review_app
### New imports ###
from mlflow.genai import evaluate
from mlflow.genai.scorers import scorer
from mlflow.genai import judges
# For predefined scorers:
from mlflow.genai.scorers import (
Correctness, Guidelines, ExpectationsGuidelines,
RelevanceToQuery, Safety, RetrievalGroundedness,
RetrievalRelevance, RetrievalSufficiency
)
import mlflow.genai.labeling as labeling
import mlflow.genai.label_schemas as schemas
Fonction d'évaluation
MLflow 2.x | MLflow 3.x |
|---|---|
|
|
|
|
| (non nécessaire) |
|
|
| (configuration dans les évaluateurs) |
Sélection du juge
MLflow 2.x | MLflow 3.x |
|---|---|
Exécute automatiquement tous les juges applicables en fonction des données | Doit explicitement spécifier quels évaluateurs utiliser |
Utilisez | Passez les scorers souhaités dans le parameter |
| Utiliser l’évaluateur |
Juges sélectionnés en fonction des champs de données disponibles | Vous contrôlez exactement quels évaluateurs s'exécutent. |
Champs de données
Champ MLflow 2.x | Champ MLflow 3.x | Description |
|---|---|---|
|
| Entrée de l'agent |
|
| Sortie de l'agent |
|
| Vérité terrain |
| Accessible via des traces | Contexte de la trace |
| Partie de la configuration de l'évaluateur | Déplacé au niveau de l'évaluateur |
Métriques personnalisées et scorers
MLflow 2.x | MLflow 3.x | Notes |
|---|---|---|
|
| Nouveau nom |
|
| Plus simple |
Plusieurs paramètres attendus : * | Param | Consolidé |
| Fait partie de | Plus simple |
|
| Nomenclature cohérente |
|
| Nomenclature cohérente |
Accès aux résultats
MLflow 2.x | MLflow 3.x |
|---|---|
|
|
Accès direct au DataFrame | Itérer sur les traces et les évaluations |
Juges LLM
Cas d'usage | MLflow 2.x | MLflow 3.x recommandé. |
|---|---|---|
Vérification de la correction de base |
|
|
Évaluation de la sécurité |
|
|
Directives globales |
|
|
Directives par ligne d'ensemble d'évaluation |
|
|
Vérifiez le soutien factuel. |
|
|
Vérifiez la pertinence du contexte |
|
|
Vérifier la pertinence des segments de contexte |
|
|
Vérifier que le contexte est complet |
|
|
Logique personnalisée complexe | Appels directs de juges dans | Évaluateurs prédéfinis ou |
Feedback humain
MLflow 2.x | MLflow 3.x |
|---|---|
|
|
|
|
|
|
|
|
Commandes de migration courantes
# Find old evaluate calls
grep -r "mlflow.evaluate" . --include="*.py"
# Find old metric decorators
grep -r "@metric" . --include="*.py"
# Find old data fields
grep -r '"request":\|"response":\|"expected_response":' . --include="*.py"
# Find old imports
grep -r "databricks.agents" . --include="*.py"
Ressources supplémentaires
- Guide d'évaluation MLflow GenAI
- Documentation des évaluateurs personnalisés
- Retour d'expérience humain avec les sessions d'étiquetage
- Évaluateurs de juge prédéfinis
- MLflow Tracing Guide
Pour une assistance supplémentaire lors de la migration, consultez la documentation MLflow ou contactez votre équipe de support Databricks.