Aller au contenu principal

Définir la « qualité » : ensembles d'évaluation

Cet article décrit les ensembles d'évaluation et comment ils contribuent à garantir la qualité de votre application.

Qu'est-ce qu'un ensemble d'évaluation ?

Pour mesurer la qualité, Databricks recommande de créer un ensemble d'évaluation labellisé par l'homme. Un ensemble d'évaluation est un ensemble de queries organisé et représentatif, ainsi que des réponses de vérité-terrain et (facultativement) des documents justificatifs corrects qui devraient être récupérés. L'intervention humaine est cruciale dans ce processus, car elle garantit que l'ensemble d'évaluation reflète fidèlement les attentes et les exigences des utilisateurs finaux.

La curation d'étiquettes humaines peut être un processus chronophage. Vous pouvez start en créant un ensemble d'évaluation qui ne comprend que des questions, et ajouter les réponses de vérité terrain au fil du temps. Agent Evaluation peut évaluer la qualité de votre chaîne sans vérité terrain, mais si une vérité terrain est disponible, elle calcule des métriques supplémentaires telles que l'exactitude des réponses.

Éléments d'un bon jeu d'évaluation

Un bon jeu d'évaluation présente les caractéristiques suivantes :

  • Représentatif : Reflète avec précision la variété des requêtes que l'application rencontrera en production.
  • **Difficile :** L'ensemble doit inclure des cas difficiles et diversifiés pour tester efficacement les capacités du modèle. Idéalement, cela inclut des exemples adverses, tels que des questions tentant une injection d'invites ou des questions tentant de générer des réponses inappropriées de la part du LLM.
  • Mise à jour continue : L’ensemble doit être mis à jour périodiquement pour refléter la façon dont l’application est utilisée en production, la nature changeante des données indexées et toute modification des exigences de l’application.

Databricks recommande au moins 30 questions dans votre jeu d'évaluation, et idéalement 100 à 200. Les meilleurs ensembles d'évaluation s'étofferont avec le temps pour contenir des milliers de questions.

Ensembles d'entraînement, de test et de validation.

Pour éviter le surapprentissage, Databricks recommande de scinder votre ensemble d’évaluation en ensembles d’entraînement, de test et de validation :

  • Jeu d'entraînement : environ 70 % des questions. Utilisé pour une première passe afin d'évaluer chaque expérimentation et d'identifier celles ayant le plus grand potentiel.
  • Jeu de test : ~20 % des questions. Utilisé pour évaluer les expérimentations les plus performantes de l'ensemble d'entraînement.
  • Ensemble de validation : environ 10 % des questions. Utilisé pour un contrôle de validation final avant de déployer une Experimentation en production.

Agent Evaluation vous aide à créer un ensemble d'évaluation en fournissant une interface de discussion Web permettant à vos parties prenantes de fournir des commentaires sur les résultats de l'application. Les résultats de la chaîne et les commentaires des parties prenantes sont enregistrés dans les tables Delta, qui peuvent ensuite être organisées en un ensemble d'évaluation. En savoir plus sur l'évaluation et l'amélioration itératives de votre application dans 3. Itérer sur la qualité des agents.