Juges LLM intégrés
Les juges LLM intégrés sont des évaluateurs prédéfinis qui utilisent les LLM hébergés par Databricks pour évaluer les dimensions de qualité courantes de votre application GenAI, telles que la pertinence, la sécurité, l'ancrage et l'exactitude. Utilisez-les lorsque vous souhaitez start à évaluer rapidement la qualité. Pour les situations où vous souhaitez un meilleur contrôle sur vos juges, utilisez les juges LLM personnalisés ou Python (évaluateurs basés sur du code).
Pour la liste complète et la documentation détaillée, consultez la documentation des scorers prédéfinis MLflow.
Juges disponibles
Juge | Arguments | Nécessite la vérité de terrain | Ce qu'il évalue |
|---|---|---|---|
| Non | La réponse est-elle directement pertinente à la demande de l'utilisateur ? | |
| Non | Le contexte récupéré est-il directement pertinent pour la demande de l'utilisateur ? | |
| Non | Le contenu est-il exempt de matériel nuisible, offensant ou toxique ? | |
| Non | La réponse est-elle basée sur les informations fournies dans le contexte ? L'agent hallucine-t-il ? | |
| Oui | La réponse est-elle correcte par rapport à la vérité terrain ? | |
| Oui | Le contexte fournit-il toutes les informations nécessaires pour générer une réponse qui inclut les faits de vérité terrain ? | |
| Non | La réponse répond-elle aux critères spécifiés en langage naturel ? | |
| Non (mais nécessite des directives dans les attentes) | La réponse répond-elle aux critères de langage naturel par exemple ? | |
| Oui | Les appels d'outils et les arguments sont-ils corrects pour la query de l'utilisateur ? | |
| Non | Les appels d'outils sont-ils efficaces sans redondance ? |
Juges multi-tours
Pour les systèmes d’IA conversationnelle, MLflow fournit des juges qui évaluent des conversations entières plutôt que des tours individuels. Ces juges analysent l’historique complet des conversations pour évaluer les modèles de qualité qui émergent au cours de multiples interactions.
Utilisez des juges multi-tours à la fois pour l'évaluation pendant le développement et pour le monitoring en production.
Pour la liste complète et la documentation détaillée, consultez la documentation des scorers prédéfinis MLflow.
Juge | Arguments | Nécessite la vérité de terrain | Ce qu'il évalue |
|---|---|---|---|
| Non | L'agent a-t-il répondu à toutes les questions de l'utilisateur tout au long de la conversation ? | |
| Non | L'utilisateur est-il devenu frustré ? La frustration a-t-elle été résolue ? | |
| Non | L'agent retient-il correctement les informations des conversations précédentes ? | |
| Non | Les réponses de l'assistant respectent-elles les directives fournies tout au long de la conversation ? | |
| Non | L'assistant maintient-il son rôle assigné tout au long de la conversation ? | |
| Non | Les réponses de l'assistant sont-elles sûres et exemptes de contenu nuisible ? | |
| Non | L'utilisation des outils tout au long de la conversation a-t-elle été efficace et appropriée ? |
Ressources supplémentaires
- Choisissez le LLM qui propulse un juge
- Créez un juge LLM personnalisé lorsque les juges intégrés ne correspondent pas à votre cas d'utilisation.
- Alignez les juges avec le retour d'expérience humain pour améliorer la précision sur votre domaine