Aller au contenu principal

Évaluer la qualité de récupération de la recherche IA

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

La recherche IA fournit une évaluation intégrée de la qualité de la récupération qui mesure et compare la pertinence de différentes stratégies de recherche sur vos données. Vous pouvez générer automatiquement des queries d'évaluation à partir de vos documents, exécuter plusieurs stratégies de récupération et générer un rapport détaillé.

Exigences

Un index de recherche IA Delta Sync géré. Consultez Créer des endpoints et des index de recherche IA.

Autorisations

Le Job d'évaluation et le tableau de bord des résultats héritent des autorisations Unity Catalog de l'index de recherche IA. Tout utilisateur ayant accès à la query de l'index peut start une exécution d'évaluation et consulter le tableau de bord des résultats. L'utilisateur qui start l'exécution de l'évaluation est le propriétaire du Job, et non le propriétaire de l'index.

Comment fonctionne l'évaluation de la qualité de la récupération de la recherche IA

L'évaluation exécute un pipeline en quatre étapes sur vos données :

  1. Générer les queries : Le système échantillonne les documents de votre table source et utilise un LLM pour générer des queries de recherche réalistes. Il génère un mélange de requêtes en langage naturel et de requêtes par mot-clé.
  2. Rechercher parmi les stratégies : chaque query générée s'exécute sur votre index à l'aide de plusieurs stratégies de récupération, y compris ANN, hybride et texte intégral. Chaque stratégie est également évaluée avec et sans le reranker. Cette approche compare les stratégies côte à côte sur le même ensemble de query. Pour plus d'informations sur chaque stratégie de récupération, consultez Algorithmes de récupération.
  3. Évaluer la pertinence : Un juge LLM évalue chaque query et paire de documents récupérés sur une échelle de pertinence à 4 points.
  4. Compute metrics and analyze : Le système calcule les indicateurs de qualité de récupération avec des intervalles de confiance. Les résultats sont conservés afin que vous puissiez les consulter ultérieurement ou les comparer entre les exécutions d'évaluation.

Start une exécution d'évaluation de la qualité de la récupération

Pour start le processus, cliquez sur Évaluer la qualité de la recherche sur la page d'index de la recherche IA. Aucune configuration n'est requise, car les valeurs default sont préremplies en fonction de vos métadonnées d'index.

Bouton d'évaluation de la qualité sur la page d'index de recherche IA.

Lorsque l'exécution est terminée, cliquez sur **Afficher les résultats** pour afficher le tableau de bord des résultats. Pour un aperçu du tableau de bord, consultez le tableau de bord des résultats.

Link pour afficher les résultats.

Pour initier une nouvelle évaluation à tout moment, cliquez Start new evaluation .

Tableau de bord des résultats

Le tableau de bord présente les résultats des exécutions d'évaluation. Utilisez le menu déroulant **Sélectionner l'exécution** pour sélectionner l'exécution à afficher.

Exemple de tableau de bord des résultats.

En haut du tableau de bord se trouvent 3 indicateurs récapitulatifs : le meilleur score DCG@10 pour tous les types de query, le type de query recommandé qui l'a obtenu, et le nombre de query évaluées.

Voir Pourquoi Databricks recommande DCG@10.

Sous les indicateurs récapitulatifs, le tableau de bord affiche un diagramme à barres qui compare les scores DCG@10 pour chaque type de query, avec et sans l'utilisation du reranker. À côté du diagramme à barres se trouvent deux tables affichant le DCG@10 et la pertinence moyenne pour chaque type de query, avec et sans le reranker.

Suit un graphique linéaire montrant comment la pertinence moyenne évolue selon les positions de résultat pour chaque type de query.

Le tableau de bord présente également les requêtes les plus et les moins performantes par score de pertinence moyen, un tableau comparant les performances de base et du reranker pour chaque type de requête, un tableau des requêtes échouées (requêtes où le meilleur résultat (top 1) a été noté 0 (non pertinent)), et un graphique linéaire qui affiche une métrique sélectionnée sur plusieurs exécutions d'évaluation au fil du temps, par métrique de requête.

Score de pertinence

L’évaluation de la qualité de la récupération utilise un LLM comme juge pour évaluer chaque paire de query et de documents récupérés sur une échelle de pertinence graduée de 4 points :

Score

Libellé

Description

Exemple

3

Très pertinent

Le document répond directement à la query ou fournit exactement les informations recherchées.

Query: « comment calculer l’aire d’un rectangle ? » Le document explique la formule longueur × largeur

2

Pertinent

Le document est lié et fournit des informations utiles, mais ne répond pas pleinement à la query

Query : « où se trouve le numéro de routage sur un chèque ? »

Le document indique « imprimé au bas d'un chèque » (partiellement complété)

1

Partiellement pertinent

Le document mentionne le sujet, mais ne fournit pas d'informations utiles pour la query.

Query : « comment calculer l'aire d'un rectangle ? »

Le document discute de la superficie des rectangles uniquement en termes généraux

0

Non pertinent

Le document n'est pas lié à la query, ou la langue du document ne correspond pas à la langue de la query.

Query en anglais

Documentez les réponses correctement, mais en français.

Score

Libellé

Description

Exemple

3

Très pertinent

Le document répond directement à la query ou fournit exactement les informations recherchées.

Query: « comment calculer l’aire d’un rectangle ? » Le document explique la formule longueur × largeur

2

Pertinent

Le document est lié et fournit des informations utiles, mais ne répond pas pleinement à la query

Query : « où se trouve le numéro de routage sur un chèque ? »

Le document indique « imprimé au bas d'un chèque » (partiellement complété)

1

Partiellement pertinent

Le document mentionne le sujet, mais ne fournit pas d'informations utiles pour la query.

Query : « comment calculer l'aire d'un rectangle ? »

Le document discute de la superficie des rectangles uniquement en termes généraux

0

Non pertinent

Le document n'est pas lié à la query, ou la langue du document ne correspond pas à la langue de la query.

Query en anglais

Documentez les réponses correctement, mais en français.

Comparée à une échelle binaire pertinente/non pertinente, l'échelle graduée saisit d'importantes distinctions. Par exemple, un document qui répond directement à une question (score 3) est significativement différent d'un document qui ne fait qu'effleurer le sujet (score 1). Cette granularité se répercute sur les métriques, en particulier le DCG, qui pondère plus fortement les résultats de meilleure qualité.

Toutes les métriques incluent des intervalles de confiance de 95 % calculés sur des valeurs par query, afin que vous puissiez évaluer si les différences entre les stratégies sont statistiquement significatives.

Métriques de récupération

En bas du tableau de bord, vous pouvez afficher une métrique sélectionnée au fil du temps. Sélectionnez la métrique à afficher dans le menu déroulant **Sélectionner la métrique**.

Afficher la métrique au fil du temps.

Cette section décrit les métriques disponibles.

DCG@k : Gain cumulatif actualisé

DCG@10 capture à la fois la pertinence des résultats et leur position dans le classement, en utilisant l’échelle de pertinence complète de 0 à 3. Databricks recommande d'utiliser DCG@10 comme métrique principale pour évaluer la qualité globale de récupération.

  • Ce qu'elle mesure : L'utilité totale des 10 meilleurs résultats, pondérée par la position. Les résultats mieux classés contribuent davantage que ceux de rang inférieur.
  • Fonctionnement : Chaque résultat contribue à un gain de 2^relevance - 1, pondéré par une remise logarithmique basée sur sa position. L'utilisation de 2^relevance - 1 (plutôt que le score de pertinence brut) met l'accent sur les résultats très pertinents : un résultat avec un score de 3 contribue 7, tandis qu'un résultat avec un score de 1 contribue 1. Le premier résultat apporte son plein gain, tandis que les résultats moins bien classés contribuent de moins en moins.
  • Plage : 0 au maximum théorique indiqué dans le tableau suivant. Plus c'est élevé, mieux c'est.

Valeurs DCG maximales théoriques, si chaque résultat marque 3 :

k

DCG max. théorique

1

7.00

3

14,92

5

20,64

10

31,80

20

49,28

k

DCG max. théorique

1

7.00

3

14,92

5

20,64

10

31,80

20

49,28

Pour mettre ces chiffres en perspective : si les 10 résultats ont une pertinence de 2 (sur une échelle de 0 à 3), le DCG@10 est de 13,63. Dans ce scénario, un gain de 1 point DCG@10 représente une amélioration significative (+7 % relative). On peut considérer qu'un seul résultat environ sur la page s'améliore sensiblement, pondéré vers le haut de la page.

NDCG@k : Gain Cumulatif Actualisé Normalisé

  • Ce qu'il mesure : la qualité du classement des résultats par rapport au meilleur classement possible. Le NDCG normalise le DCG en le divisant par le DCG idéal (le DCG si les résultats étaient triés par ordre décroissant de pertinence).
  • Plage : de 0 à 1. Un score de 1,0 signifie que les résultats sont parfaitement en ordre.
  • **Quand l'utiliser** : Lorsque vous voulez savoir si le système classe correctement les résultats, indépendamment du nombre total de documents pertinents disponibles. Consultez Pourquoi le DCG@10 est la métrique principale recommandée pour une comparaison détaillée.

Rappel@k

  • Ce que cela mesure : la fraction de documents pertinents connus qui apparaissent dans les résultats top-k.
  • Plage : de 0 à 1. Un score de 1,0 signifie que tous les documents pertinents connus ont été récupérés.
  • **Quand utiliser** : Lorsque l'exhaustivité est importante, comme dans les applications RAG où l'absence d'un document pertinent signifie que le LLM génère une réponse incomplète.

Precision@k

  • Ce qu'il mesure : La fraction des résultats top-k pertinents (score de pertinence >= 2).
  • Plage : de 0 à 1. Un score de 1,0 signifie que chaque résultat dans le top k est pertinent.
  • Quand l'utiliser : Lorsque la qualité des résultats compte plus que l'exhaustivité, comme dans les interfaces de recherche où des résultats non pertinents pourraient affecter négativement la confiance de l'utilisateur.

Score de pertinence moyen

  • Ce qu’il mesure : le score de pertinence moyen évalué par le LLM sur toutes les paires query-résultat.
  • Plage : 0 à 3. Plus c'est élevé, mieux c'est.
  • Quand l'utiliser : En tant qu'aperçu rapide de la qualité.

Distribution de la pertinence

  • **Ce qu'il mesure** : le pourcentage de résultats dans chaque catégorie de pertinence :

    • Très pertinents % : Résultats obtenant un score de 3 (réponses directes).
    • Pertinent+ % : Résultats avec un score de 2 ou plus (utiles).
    • Pourcentage non pertinent : Résultats dont le score est 0 ou 1 (non utiles).
  • Quand l'utiliser : Pour comprendre la forme de la distribution de la qualité. Deux stratégies peuvent avoir le même score moyen mais des distributions très différentes. Par exemple, une distribution bimodale (nombreux 3 et nombreux 0) pourrait suggérer qu'un modèle de query n'est pas bien récupéré et nécessite une attention particulière.

MRR : Rang réciproque moyen

  • Ce qu'elle mesure : La rapidité avec laquelle les utilisateurs trouvent le premier résultat pertinent. Le MRR est la moyenne de 1/rank à travers les queries, où rank est la position du premier résultat pertinent (score >= 2).
  • Plage : de 0 à 1. Un score de 1,0 signifie que le premier résultat est toujours pertinent.
  • Quand utiliser : lorsque le résultat le plus pertinent importe le plus, par exemple dans les systèmes de réponse aux questions.

MAP@k : Précision moyenne moyenne

  • Ce qu'il mesure : la qualité du classement sur tous les résultats pertinents, et pas seulement le premier. MAP calcule la précision à la position de chaque résultat pertinent, puis calcule la moyenne.
  • Plage : 0 à 1. Des valeurs plus élevées indiquent que les documents pertinents sont systématiquement classés en haut.
  • Quand l'utiliser : lorsque vous avez besoin d'un seul chiffre qui capture la qualité globale du classement pour tous les documents pertinents.

Pourquoi DCG@10 est la métrique principale recommandée

DCG@10 offre l’image la plus complète de la qualité de récupération pour la plupart des applications :

  • La pertinence graduée capture la nuance : Les métriques binaires comme la précision traitent tous les documents pertinents de manière égale. Un document qui répond parfaitement à la query (score 3) compte autant qu'un document qui mentionne vaguement le sujet (score 1). DCG utilise l'échelle de pertinence complète de 0 à 3, de sorte qu'un résultat noté 3 contribue significativement plus qu'un résultat noté 1.
  • La position compte : Les utilisateurs consultent d'abord les meilleurs résultats. DCG applique une remise logarithmique, de sorte que les résultats à la position 1 comptent beaucoup plus que les résultats à la position 10. Le 1er résultat contribue à son score de pertinence complet, tandis que la contribution du 10e résultat est divisée par log₂(11) ≈ 3,46.
  • L'utilité absolue révèle ce que les métriques normalisées ne saisissent pas : considérez l'exemple montré dans le tableau suivant. Les deux ensembles de résultats atteignent un NDCG parfait de 1,00 car chacun a des résultats dans un ordre idéal décroissant. Cependant, l’ensemble de résultats B offre près du double de la valeur totale (DCG 8,02 contre 4,26) car chaque résultat est utile. Le NDCG ne peut pas distinguer entre « un classement parfait de 2 bons résultats parmi 3 résultats non pertinents » et « un classement parfait de 5 bons résultats. » Le DCG répond à la question : « Combien d'informations utiles l'utilisateur a-t-il réellement obtenues ? »

Pour plus d'informations sur DCG et NDCG, consultez Discounted cumulative gain.

Résultats

Position 1

Position 2e

Position 3

Position 4e

Position 5

NDCG@5

DCG@5

Jeu de résultats A

3

2

0

0

0

1,00

4,26

Jeu de résultats B

3

3

3

2

2

1,00

8,02

Résultats

Position 1

Position 2e

Position 3

Position 4e

Position 5

NDCG@5

DCG@5

Jeu de résultats A

3

2

0

0

0

1,00

4,26

Jeu de résultats B

3

3

3

2

2

1,00

8,02

Aucune métrique unique ne raconte toute l'histoire. Utilisez la suite complète de métriques pour une image complète et sélectionnez la métrique qui correspond le mieux aux exigences de qualité de votre application.

Scénarios courants

Le tableau suivant explique les modèles de résultats d'évaluation courants, ce qu'ils signifient et comment les résoudre :

Modèle

Ce que cela signifie

Action suggérée

Hybride nettement supérieur à ANN

Les queries bénéficient de la correspondance par mot-clé.

Utilisez la recherche hybride en production.

ANN environ égal à hybride

Les mots-clés n'ajoutent pas de valeur à vos données.

L’une ou l’autre stratégie fonctionne. ANN est plus simple.

Texte intégral significativement meilleur qu'ANN

Les embeddings pourraient ne pas bien refléter votre domaine.

Envisagez d'affiner votre modèle d'intégration ou d'utiliser la recherche en texte intégral.

Le réorganisateur améliore considérablement les métriques

Le Cross-encodeur apporte un gain de qualité significatif.

Activez le reranker si le budget de latence le permet.

Intervalles de confiance larges

Pas assez de requêtes pour une comparaison fiable.

Augmentez le nombre de queries d'évaluation.

Toutes les stratégies obtiennent un score faible

Problèmes de qualité ou de pertinence des données.

Consultez le guide de la qualité de recherche IA pour un guide détaillé sur l'amélioration de la qualité de la recherche.

Modèle

Ce que cela signifie

Action suggérée

Hybride nettement supérieur à ANN

Les queries bénéficient de la correspondance par mot-clé.

Utilisez la recherche hybride en production.

ANN environ égal à hybride

Les mots-clés n'ajoutent pas de valeur à vos données.

L’une ou l’autre stratégie fonctionne. ANN est plus simple.

Texte intégral significativement meilleur qu'ANN

Les embeddings pourraient ne pas bien refléter votre domaine.

Envisagez d'affiner votre modèle d'intégration ou d'utiliser la recherche en texte intégral.

Le réorganisateur améliore considérablement les métriques

Le Cross-encodeur apporte un gain de qualité significatif.

Activez le reranker si le budget de latence le permet.

Intervalles de confiance larges

Pas assez de requêtes pour une comparaison fiable.

Augmentez le nombre de queries d'évaluation.

Toutes les stratégies obtiennent un score faible

Problèmes de qualité ou de pertinence des données.

Consultez le guide de la qualité de recherche IA pour un guide détaillé sur l'amélioration de la qualité de la recherche.