Évaluateurs tiers
MLflow s’intègre aux frameworks d’évaluation open source populaires afin que vous puissiez utiliser leurs métriques spécialisées en tant qu’évaluateurs, aux côtés des juges LLM intégrés et des évaluateurs basés sur du code. Les évaluateurs tiers s'intègrent directement à mlflow.genai.evaluate(), vous donnant accès à une vaste bibliothèque de métriques d'évaluation via une interface unique et unifiée.
Pourquoi utiliser des évaluateurs tiers
Les évaluateurs tiers sont utiles lorsque vous avez besoin :
- **Métriques spécialisées** non couvertes par les juges intégrés, telles que la qualité du plan de l'agent, la détection des tentatives de contournement ou les scores de comparaison de texte BLEU/ROUGE.
- Points forts spécifiques au framework des bibliothèques que votre équipe utilise déjà, sans modifier votre workflow d'évaluation.
- Évaluation combinée sur plusieurs frameworks en un seul appel
mlflow.genai.evaluate(), avec les résultats visualisés ensemble dans l'interface utilisateur de MLflow.
Intégrations disponibles
Chaque intégration encapsule les métriques d'un framework tiers en tant que scorers MLflow. Installez le package du framework, importez le scorer, et transmettez-le à mlflow.genai.evaluate().
Intégration | Quand utiliser : |
|---|---|
Vous avez besoin de la couverture de métriques la plus large pour la RAG, les agents, l'IA conversationnelle et la sécurité. DeepEval propose des évaluateurs spécialisés pour la qualité des plans d'agent, l'efficacité des étapes, l'exhaustivité des conversations multi-tours et l'adhérence aux rôles, ce que d'autres frameworks ne fournissent pas. | |
Vous avez besoin d'une évaluation RAG approfondie avec des métriques de contexte granulaires (précision, rappel, utilisation, sensibilité au bruit), d'une précision d'objectif d'agent ou de scores de comparaison de texte déterministes comme BLEU, ROUGE et la similarité sémantique sans appels LLM. | |
Vous avez besoin d'un ensemble de scorers léger et ciblé pour la détection des hallucinations, l'évaluation de la pertinence, l'identification de la toxicité, la correction QA ou la qualité de la synthèse. | |
Vous devez analyser les traces d'exécution des agents avec des métriques d'alignement objectif-plan-action telles que la cohérence logique, l'efficacité de l'exécution, le respect du plan et la sélection des outils. | |
Vous avez besoin d'une validation de sortie basée sur des règles qui s'exécute sans appels LLM, comme la détection de toxicité, l'analyse PII, la détection de jailbreak, la détection de secrets ou l'identification de charabia. |
Exemple rapide
L'exemple suivant combine des scorers de deux frameworks différents dans une seule évaluation :
import mlflow
from mlflow.genai.scorers.deepeval import AnswerRelevancy
from mlflow.genai.scorers.guardrails import ToxicLanguage
eval_dataset = [
{
"inputs": {"query": "What is MLflow?"},
"outputs": "MLflow is an open-source platform for managing ML and GenAI workloads.",
},
]
results = mlflow.genai.evaluate(
data=eval_dataset,
scorers=[
AnswerRelevancy(threshold=0.7, model="databricks:/databricks-gpt-5-mini"),
ToxicLanguage(threshold=0.7),
],
)
Quand utiliser des scorers tiers ou intégrés
Start with les juges LLM intégrés pour les besoins d'évaluation courants tels que l'exactitude, l'ancrage et la sécurité. Ajoutez des évaluateurs tiers dans les situations suivantes :
- Vous utilisez déjà ces bibliothèques dans vos workflows et souhaitez profiter d’autres fonctionnalités MLflow.
- Vous avez besoin de métriques pour un domaine spécifique que les juges intégrés ne couvrent pas, telles que l’efficacité des étapes de l’agent ou l’exhaustivité de la conversation.
- Vous avez besoin de mesures d’évaluation déterministes, non-LLM, telles que les scores BLEU, la correspondance exacte ou la correspondance de modèles regex.
- Vous avez besoin de validateurs basés sur des règles qui s'exécutent sans appels LLM, tels que la détection des PII ou l'analyse des secrets.