Aller au contenu principal

Juges LLM intégrés

Les juges LLM intégrés sont des évaluateurs prédéfinis qui utilisent les LLM hébergés par Databricks pour évaluer les dimensions de qualité courantes de votre application GenAI, telles que la pertinence, la sécurité, l'ancrage et l'exactitude. Utilisez-les lorsque vous souhaitez start à évaluer rapidement la qualité. Pour les situations où vous souhaitez un meilleur contrôle sur vos juges, utilisez les juges LLM personnalisés ou Python (évaluateurs basés sur du code).

Pour la liste complète et la documentation détaillée, consultez la documentation des scorers prédéfinis MLflow.

Juges disponibles

Juge

Arguments

Nécessite la vérité de terrain

Ce qu'il évalue

RelevanceToQuery

inputs, outputs

Non

La réponse est-elle directement pertinente à la demande de l'utilisateur ?

RetrievalRelevance

inputs, outputs

Non

Le contexte récupéré est-il directement pertinent pour la demande de l'utilisateur ?

Safety

inputs, outputs

Non

Le contenu est-il exempt de matériel nuisible, offensant ou toxique ?

RetrievalGroundedness

inputs, outputs

Non

La réponse est-elle basée sur les informations fournies dans le contexte ? L'agent hallucine-t-il ?

Correctness

inputs, outputs, expectations

Oui

La réponse est-elle correcte par rapport à la vérité terrain ?

RetrievalSufficiency

inputs, outputs, expectations

Oui

Le contexte fournit-il toutes les informations nécessaires pour générer une réponse qui inclut les faits de vérité terrain ?

Guidelines

inputs, outputs

Non

La réponse répond-elle aux critères spécifiés en langage naturel ?

ExpectationsGuidelines

inputs, outputs, expectations

Non (mais nécessite des directives dans les attentes)

La réponse répond-elle aux critères de langage naturel par exemple ?

ToolCallCorrectness

inputs, outputs, expectations

Oui

Les appels d'outils et les arguments sont-ils corrects pour la query de l'utilisateur ?

ToolCallEfficiency

inputs, outputs

Non

Les appels d'outils sont-ils efficaces sans redondance ?

Juge

Arguments

Nécessite la vérité de terrain

Ce qu'il évalue

RelevanceToQuery

inputs, outputs

Non

La réponse est-elle directement pertinente à la demande de l'utilisateur ?

RetrievalRelevance

inputs, outputs

Non

Le contexte récupéré est-il directement pertinent pour la demande de l'utilisateur ?

Safety

inputs, outputs

Non

Le contenu est-il exempt de matériel nuisible, offensant ou toxique ?

RetrievalGroundedness

inputs, outputs

Non

La réponse est-elle basée sur les informations fournies dans le contexte ? L'agent hallucine-t-il ?

Correctness

inputs, outputs, expectations

Oui

La réponse est-elle correcte par rapport à la vérité terrain ?

RetrievalSufficiency

inputs, outputs, expectations

Oui

Le contexte fournit-il toutes les informations nécessaires pour générer une réponse qui inclut les faits de vérité terrain ?

Guidelines

inputs, outputs

Non

La réponse répond-elle aux critères spécifiés en langage naturel ?

ExpectationsGuidelines

inputs, outputs, expectations

Non (mais nécessite des directives dans les attentes)

La réponse répond-elle aux critères de langage naturel par exemple ?

ToolCallCorrectness

inputs, outputs, expectations

Oui

Les appels d'outils et les arguments sont-ils corrects pour la query de l'utilisateur ?

ToolCallEfficiency

inputs, outputs

Non

Les appels d'outils sont-ils efficaces sans redondance ?

Juges multi-tours

Pour les systèmes d’IA conversationnelle, MLflow fournit des juges qui évaluent des conversations entières plutôt que des tours individuels. Ces juges analysent l’historique complet des conversations pour évaluer les modèles de qualité qui émergent au cours de multiples interactions.

Utilisez des juges multi-tours à la fois pour l'évaluation pendant le développement et pour le monitoring en production.

Pour la liste complète et la documentation détaillée, consultez la documentation des scorers prédéfinis MLflow.

Juge

Arguments

Nécessite la vérité de terrain

Ce qu'il évalue

ConversationCompleteness

session

Non

L'agent a-t-il répondu à toutes les questions de l'utilisateur tout au long de la conversation ?

UserFrustration

session

Non

L'utilisateur est-il devenu frustré ? La frustration a-t-elle été résolue ?

KnowledgeRetention

session

Non

L'agent retient-il correctement les informations des conversations précédentes ?

ConversationalGuidelines

session, guidelines

Non

Les réponses de l'assistant respectent-elles les directives fournies tout au long de la conversation ?

ConversationalRoleAdherence

session

Non

L'assistant maintient-il son rôle assigné tout au long de la conversation ?

ConversationalSafety

session

Non

Les réponses de l'assistant sont-elles sûres et exemptes de contenu nuisible ?

ConversationalToolCallEfficiency

session

Non

L'utilisation des outils tout au long de la conversation a-t-elle été efficace et appropriée ?

Juge

Arguments

Nécessite la vérité de terrain

Ce qu'il évalue

ConversationCompleteness

session

Non

L'agent a-t-il répondu à toutes les questions de l'utilisateur tout au long de la conversation ?

UserFrustration

session

Non

L'utilisateur est-il devenu frustré ? La frustration a-t-elle été résolue ?

KnowledgeRetention

session

Non

L'agent retient-il correctement les informations des conversations précédentes ?

ConversationalGuidelines

session, guidelines

Non

Les réponses de l'assistant respectent-elles les directives fournies tout au long de la conversation ?

ConversationalRoleAdherence

session

Non

L'assistant maintient-il son rôle assigné tout au long de la conversation ?

ConversationalSafety

session

Non

Les réponses de l'assistant sont-elles sûres et exemptes de contenu nuisible ?

ConversationalToolCallEfficiency

session

Non

L'utilisation des outils tout au long de la conversation a-t-elle été efficace et appropriée ?

Ressources supplémentaires