Aller au contenu principal

Évaluer les performances : métriques importantes

Cet article couvre la mesure des performances d'une application RAG pour la qualité de l'extraction, de la réponse et des performances du système.

Récupération, réponse et performance

Avec un jeu d'évaluation, vous pouvez mesurer les performances de votre application RAG selon un certain nombre de dimensions différentes, notamment :

  • Qualité de la récupération : les métriques de récupération évaluent l'efficacité avec laquelle votre application RAG récupère les données de support pertinentes. Précision et rappel sont deux principales métriques de récupération.
  • Qualité de la réponse : Les métriques de qualité de la réponse évaluent dans quelle mesure l’application RAG répond à la requête d’un utilisateur. Les métriques de réponse peuvent mesurer, par exemple, si la réponse résultante est exacte par rapport à la vérité terrain, à quel point la réponse était ancrée dans le contexte récupéré (par exemple, le LLM a-t-il halluciné ?), ou à quel point la réponse était sûre (en d'autres termes, sans toxicité).
  • Performances du système (coût et latence) : les métriques mesurent le coût global et les performances des applications RAG. La latence globale et la consommation de jetons sont des exemples de métriques de performance de la chaîne.

Il est très important de collecter les métriques de réponse et de récupération. Une application RAG peut mal répondre malgré la récupération du bon contexte ; elle peut également fournir de bonnes réponses basées sur des récupérations erronées. Ce n'est qu'en mesurant les deux composants que nous pouvons diagnostiquer et résoudre précisément les problèmes de l'application.

Approches pour mesurer les performances

Il existe deux approches clés pour mesurer les performances par rapport à ces métriques :

  • Mesure déterministe : les métriques de coût et de latence peuvent être calculées de manière déterministe en fonction des sorties de l'application. Si votre ensemble d'évaluation comprend une liste de documents qui contiennent la réponse à une question, un sous-ensemble des métriques de récupération peut également être calculé de manière déterministe.
  • Mesure basée sur un juge LLM : dans cette approche, un LLM distinct agit comme un juge pour évaluer la qualité de la récupération et des réponses de l'application RAG. Certains juges LLM, tels que l'exactitude des réponses, comparent la vérité terrain étiquetée par l'humain aux sorties de l'application. D'autres juges LLM, tels que l'ancrage, ne nécessitent pas de vérité terrain étiquetée par l'humain pour évaluer les sorties de leurs applications.
important

Pour qu'un juge LLM soit efficace, il doit être ajusté pour comprendre le cas d'utilisation. Cela nécessite une attention particulière pour comprendre où le juge fonctionne bien et moins bien, puis d'ajuster le juge pour l'améliorer dans les cas d'échec.

Agent Evaluation fournit une implémentation prête à l'emploi, utilisant des modèles de jugement LLM hébergés, pour chaque métrique abordée sur cette page. La documentation d’Agent Evaluation traite des détails sur la manière dont ces métriques et juges sont implémentés et fournit des fonctionnalités pour affiner les juges avec vos données afin d’augmenter leur précision.

Aperçu des métriques

Vous trouverez ci-dessous un résumé des métriques que Databricks recommande pour mesurer la qualité, le coût et la latence de votre application RAG. Ces métriques sont implémentées dans Agent Evaluation.

Dimension

Nom de la métrique

Question

Mesuré par

Faut-il une vérité terrain ?

Récupération

chunk_relevance/précision

Quel % des segments récupérés sont pertinents par rapport à la demande ?

Juge LLM

Non

Récupération

rappel de document

Quel % des documents de vérité terrain est représenté dans les fragments récupérés ?

Déterministe

Oui

Récupération

context_sufficiency

Les segments récupérés sont-ils suffisants pour produire la réponse attendue ?

Juge LLM

Oui

Réponse

Exactitude

Dans l'ensemble, l'agent a-t-il généré une réponse correcte ?

Juge LLM

Oui

Réponse

relevance_to_query

La réponse est-elle pertinente par rapport à la requête ?

Juge LLM

Non

Réponse

ancrage

La réponse est-elle une hallucination ou est-elle ancrée dans le contexte ?

Juge LLM

Non

Réponse

Sécurité

Y a-t-il du contenu dangereux dans la réponse ?

Juge LLM

Non

Coût

total_token_count, total_input_token_count, total_output_token_count

Quel est le nombre total de jetons pour les générations de LLM ?

Déterministe

Non

Latence

latency_seconds

Quelle est la latence d'exécution de l'application ?

Déterministe

Non

Dimension

Nom de la métrique

Question

Mesuré par

Faut-il une vérité terrain ?

Récupération

chunk_relevance/précision

Quel % des segments récupérés sont pertinents par rapport à la demande ?

Juge LLM

Non

Récupération

rappel de document

Quel % des documents de vérité terrain est représenté dans les fragments récupérés ?

Déterministe

Oui

Récupération

context_sufficiency

Les segments récupérés sont-ils suffisants pour produire la réponse attendue ?

Juge LLM

Oui

Réponse

Exactitude

Dans l'ensemble, l'agent a-t-il généré une réponse correcte ?

Juge LLM

Oui

Réponse

relevance_to_query

La réponse est-elle pertinente par rapport à la requête ?

Juge LLM

Non

Réponse

ancrage

La réponse est-elle une hallucination ou est-elle ancrée dans le contexte ?

Juge LLM

Non

Réponse

Sécurité

Y a-t-il du contenu dangereux dans la réponse ?

Juge LLM

Non

Coût

total_token_count, total_input_token_count, total_output_token_count

Quel est le nombre total de jetons pour les générations de LLM ?

Déterministe

Non

Latence

latency_seconds

Quelle est la latence d'exécution de l'application ?

Déterministe

Non

Fonctionnement des métriques de récupération

Les métriques de récupération vous aident à comprendre si votre récupérateur fournit des résultats pertinents. Les métriques de récupération sont basées sur la précision et le rappel.

Nom de la métrique

Question répondue

Détails

Précision

Quel % des segments récupérés sont pertinents par rapport à la demande ?

La précision est la proportion de documents récupérés qui sont réellement pertinents pour la demande de l'utilisateur. Un juge LLM peut être utilisé pour évaluer la pertinence de chaque segment récupéré par rapport à la demande de l'utilisateur.

Rappel

Quel % des documents de vérité terrain est représenté dans les fragments récupérés ?

Le rappel est la proportion des documents de vérité terrain qui sont représentés dans les fragments récupérés. Il s'agit d'une mesure de l'exhaustivité des résultats.

Nom de la métrique

Question répondue

Détails

Précision

Quel % des segments récupérés sont pertinents par rapport à la demande ?

La précision est la proportion de documents récupérés qui sont réellement pertinents pour la demande de l'utilisateur. Un juge LLM peut être utilisé pour évaluer la pertinence de chaque segment récupéré par rapport à la demande de l'utilisateur.

Rappel

Quel % des documents de vérité terrain est représenté dans les fragments récupérés ?

Le rappel est la proportion des documents de vérité terrain qui sont représentés dans les fragments récupérés. Il s'agit d'une mesure de l'exhaustivité des résultats.

Précision et rappel

Voici une brève introduction sur la précision et le rappel adaptés de l'excellent article Wikipédia.

Formule de précision

La précision mesure « Parmi les fragments que j'ai récupérés, quel % de ces éléments est réellement pertinent pour la query de mon utilisateur ? » Calculer la précision ne nécessite **pas** de connaître **tous** les éléments pertinents.

Formule de calcul de la précision.

Formule de rappel

Le rappel mesure « Parmi TOUS les documents que je sais pertinents pour la query de mon utilisateur, de quel % ai-je récupéré un fragment ? » Le calcul du rappel exige que votre vérité terrain contienne tous les éléments pertinents. Les éléments peuvent être un document ou un fragment de document.

Formule de calcul du rappel.

Dans l'exemple ci-dessous, deux des trois résultats récupérés étaient pertinents pour la query de l'utilisateur, donc la précision était de 0,66 (2/3). Les documents récupérés comprenaient deux documents pertinents sur un total de quatre, donc le rappel était de 0,5 (2/4).

Diagramme montrant la mesure de précision et de rappel.