Évaluer les performances : métriques importantes
Cet article couvre la mesure des performances d'une application RAG pour la qualité de l'extraction, de la réponse et des performances du système.
Récupération, réponse et performance
Avec un jeu d'évaluation, vous pouvez mesurer les performances de votre application RAG selon un certain nombre de dimensions différentes, notamment :
- Qualité de la récupération : les métriques de récupération évaluent l'efficacité avec laquelle votre application RAG récupère les données de support pertinentes. Précision et rappel sont deux principales métriques de récupération.
- Qualité de la réponse : Les métriques de qualité de la réponse évaluent dans quelle mesure l’application RAG répond à la requête d’un utilisateur. Les métriques de réponse peuvent mesurer, par exemple, si la réponse résultante est exacte par rapport à la vérité terrain, à quel point la réponse était ancrée dans le contexte récupéré (par exemple, le LLM a-t-il halluciné ?), ou à quel point la réponse était sûre (en d'autres termes, sans toxicité).
- Performances du système (coût et latence) : les métriques mesurent le coût global et les performances des applications RAG. La latence globale et la consommation de jetons sont des exemples de métriques de performance de la chaîne.
Il est très important de collecter les métriques de réponse et de récupération. Une application RAG peut mal répondre malgré la récupération du bon contexte ; elle peut également fournir de bonnes réponses basées sur des récupérations erronées. Ce n'est qu'en mesurant les deux composants que nous pouvons diagnostiquer et résoudre précisément les problèmes de l'application.
Approches pour mesurer les performances
Il existe deux approches clés pour mesurer les performances par rapport à ces métriques :
- Mesure déterministe : les métriques de coût et de latence peuvent être calculées de manière déterministe en fonction des sorties de l'application. Si votre ensemble d'évaluation comprend une liste de documents qui contiennent la réponse à une question, un sous-ensemble des métriques de récupération peut également être calculé de manière déterministe.
- Mesure basée sur un juge LLM : dans cette approche, un LLM distinct agit comme un juge pour évaluer la qualité de la récupération et des réponses de l'application RAG. Certains juges LLM, tels que l'exactitude des réponses, comparent la vérité terrain étiquetée par l'humain aux sorties de l'application. D'autres juges LLM, tels que l'ancrage, ne nécessitent pas de vérité terrain étiquetée par l'humain pour évaluer les sorties de leurs applications.
Pour qu'un juge LLM soit efficace, il doit être ajusté pour comprendre le cas d'utilisation. Cela nécessite une attention particulière pour comprendre où le juge fonctionne bien et moins bien, puis d'ajuster le juge pour l'améliorer dans les cas d'échec.
Agent Evaluation fournit une implémentation prête à l'emploi, utilisant des modèles de jugement LLM hébergés, pour chaque métrique abordée sur cette page. La documentation d’Agent Evaluation traite des détails sur la manière dont ces métriques et juges sont implémentés et fournit des fonctionnalités pour affiner les juges avec vos données afin d’augmenter leur précision.
Aperçu des métriques
Vous trouverez ci-dessous un résumé des métriques que Databricks recommande pour mesurer la qualité, le coût et la latence de votre application RAG. Ces métriques sont implémentées dans Agent Evaluation.
Dimension | Nom de la métrique | Question | Mesuré par | Faut-il une vérité terrain ? |
|---|---|---|---|---|
Récupération | chunk_relevance/précision | Quel % des segments récupérés sont pertinents par rapport à la demande ? | Juge LLM | Non |
Récupération | rappel de document | Quel % des documents de vérité terrain est représenté dans les fragments récupérés ? | Déterministe | Oui |
Récupération | context_sufficiency | Les segments récupérés sont-ils suffisants pour produire la réponse attendue ? | Juge LLM | Oui |
Réponse | Exactitude | Dans l'ensemble, l'agent a-t-il généré une réponse correcte ? | Juge LLM | Oui |
Réponse | relevance_to_query | Juge LLM | Non | |
Réponse | ancrage | La réponse est-elle une hallucination ou est-elle ancrée dans le contexte ? | Juge LLM | Non |
Réponse | Sécurité | Juge LLM | Non | |
Coût | total_token_count, total_input_token_count, total_output_token_count | Quel est le nombre total de jetons pour les générations de LLM ? | Déterministe | Non |
Latence | latency_seconds | Déterministe | Non |
Fonctionnement des métriques de récupération
Les métriques de récupération vous aident à comprendre si votre récupérateur fournit des résultats pertinents. Les métriques de récupération sont basées sur la précision et le rappel.
Nom de la métrique | Question répondue | Détails |
|---|---|---|
Précision | Quel % des segments récupérés sont pertinents par rapport à la demande ? | La précision est la proportion de documents récupérés qui sont réellement pertinents pour la demande de l'utilisateur. Un juge LLM peut être utilisé pour évaluer la pertinence de chaque segment récupéré par rapport à la demande de l'utilisateur. |
Rappel | Quel % des documents de vérité terrain est représenté dans les fragments récupérés ? | Le rappel est la proportion des documents de vérité terrain qui sont représentés dans les fragments récupérés. Il s'agit d'une mesure de l'exhaustivité des résultats. |
Précision et rappel
Voici une brève introduction sur la précision et le rappel adaptés de l'excellent article Wikipédia.
Formule de précision
La précision mesure « Parmi les fragments que j'ai récupérés, quel % de ces éléments est réellement pertinent pour la query de mon utilisateur ? » Calculer la précision ne nécessite **pas** de connaître **tous** les éléments pertinents.

Formule de rappel
Le rappel mesure « Parmi TOUS les documents que je sais pertinents pour la query de mon utilisateur, de quel % ai-je récupéré un fragment ? » Le calcul du rappel exige que votre vérité terrain contienne tous les éléments pertinents. Les éléments peuvent être un document ou un fragment de document.

Dans l'exemple ci-dessous, deux des trois résultats récupérés étaient pertinents pour la query de l'utilisateur, donc la précision était de 0,66 (2/3). Les documents récupérés comprenaient deux documents pertinents sur un total de quatre, donc le rappel était de 0,5 (2/4).
