Aller au contenu principal

Évaluateurs tiers

MLflow s’intègre aux frameworks d’évaluation open source populaires afin que vous puissiez utiliser leurs métriques spécialisées en tant qu’évaluateurs, aux côtés des juges LLM intégrés et des évaluateurs basés sur du code. Les évaluateurs tiers s'intègrent directement à mlflow.genai.evaluate(), vous donnant accès à une vaste bibliothèque de métriques d'évaluation via une interface unique et unifiée.

Pourquoi utiliser des évaluateurs tiers

Les évaluateurs tiers sont utiles lorsque vous avez besoin :

  • **Métriques spécialisées** non couvertes par les juges intégrés, telles que la qualité du plan de l'agent, la détection des tentatives de contournement ou les scores de comparaison de texte BLEU/ROUGE.
  • Points forts spécifiques au framework des bibliothèques que votre équipe utilise déjà, sans modifier votre workflow d'évaluation.
  • Évaluation combinée sur plusieurs frameworks en un seul appel mlflow.genai.evaluate(), avec les résultats visualisés ensemble dans l'interface utilisateur de MLflow.

Intégrations disponibles

Chaque intégration encapsule les métriques d'un framework tiers en tant que scorers MLflow. Installez le package du framework, importez le scorer, et transmettez-le à mlflow.genai.evaluate().

Intégration

Quand utiliser :

Scorers DeepEval

Vous avez besoin de la couverture de métriques la plus large pour la RAG, les agents, l'IA conversationnelle et la sécurité. DeepEval propose des évaluateurs spécialisés pour la qualité des plans d'agent, l'efficacité des étapes, l'exhaustivité des conversations multi-tours et l'adhérence aux rôles, ce que d'autres frameworks ne fournissent pas.

Évaluateurs RAGAS

Vous avez besoin d'une évaluation RAG approfondie avec des métriques de contexte granulaires (précision, rappel, utilisation, sensibilité au bruit), d'une précision d'objectif d'agent ou de scores de comparaison de texte déterministes comme BLEU, ROUGE et la similarité sémantique sans appels LLM.

Évaluateurs Arize Phoenix

Vous avez besoin d'un ensemble de scorers léger et ciblé pour la détection des hallucinations, l'évaluation de la pertinence, l'identification de la toxicité, la correction QA ou la qualité de la synthèse.

Évaluateurs TruLens

Vous devez analyser les traces d'exécution des agents avec des métriques d'alignement objectif-plan-action telles que la cohérence logique, l'efficacité de l'exécution, le respect du plan et la sélection des outils.

Évaluateurs IA de garde-fous

Vous avez besoin d'une validation de sortie basée sur des règles qui s'exécute sans appels LLM, comme la détection de toxicité, l'analyse PII, la détection de jailbreak, la détection de secrets ou l'identification de charabia.

Intégration

Quand utiliser :

Scorers DeepEval

Vous avez besoin de la couverture de métriques la plus large pour la RAG, les agents, l'IA conversationnelle et la sécurité. DeepEval propose des évaluateurs spécialisés pour la qualité des plans d'agent, l'efficacité des étapes, l'exhaustivité des conversations multi-tours et l'adhérence aux rôles, ce que d'autres frameworks ne fournissent pas.

Évaluateurs RAGAS

Vous avez besoin d'une évaluation RAG approfondie avec des métriques de contexte granulaires (précision, rappel, utilisation, sensibilité au bruit), d'une précision d'objectif d'agent ou de scores de comparaison de texte déterministes comme BLEU, ROUGE et la similarité sémantique sans appels LLM.

Évaluateurs Arize Phoenix

Vous avez besoin d'un ensemble de scorers léger et ciblé pour la détection des hallucinations, l'évaluation de la pertinence, l'identification de la toxicité, la correction QA ou la qualité de la synthèse.

Évaluateurs TruLens

Vous devez analyser les traces d'exécution des agents avec des métriques d'alignement objectif-plan-action telles que la cohérence logique, l'efficacité de l'exécution, le respect du plan et la sélection des outils.

Évaluateurs IA de garde-fous

Vous avez besoin d'une validation de sortie basée sur des règles qui s'exécute sans appels LLM, comme la détection de toxicité, l'analyse PII, la détection de jailbreak, la détection de secrets ou l'identification de charabia.

Exemple rapide

L'exemple suivant combine des scorers de deux frameworks différents dans une seule évaluation :

Python
import mlflow
from mlflow.genai.scorers.deepeval import AnswerRelevancy
from mlflow.genai.scorers.guardrails import ToxicLanguage

eval_dataset = [
{
"inputs": {"query": "What is MLflow?"},
"outputs": "MLflow is an open-source platform for managing ML and GenAI workloads.",
},
]

results = mlflow.genai.evaluate(
data=eval_dataset,
scorers=[
AnswerRelevancy(threshold=0.7, model="databricks:/databricks-gpt-5-mini"),
ToxicLanguage(threshold=0.7),
],
)

Quand utiliser des scorers tiers ou intégrés

Start with les juges LLM intégrés pour les besoins d'évaluation courants tels que l'exactitude, l'ancrage et la sécurité. Ajoutez des évaluateurs tiers dans les situations suivantes :

  • Vous utilisez déjà ces bibliothèques dans vos workflows et souhaitez profiter d’autres fonctionnalités MLflow.
  • Vous avez besoin de métriques pour un domaine spécifique que les juges intégrés ne couvrent pas, telles que l’efficacité des étapes de l’agent ou l’exhaustivité de la conversation.
  • Vous avez besoin de mesures d’évaluation déterministes, non-LLM, telles que les scores BLEU, la correspondance exacte ou la correspondance de modèles regex.
  • Vous avez besoin de validateurs basés sur des règles qui s'exécutent sans appels LLM, tels que la détection des PII ou l'analyse des secrets.