Aller au contenu principal

Activer la mesure : Infrastructure de support

Cet article détaille l'infrastructure nécessaire pour mesurer la qualité et comment Databricks la fournit. Mesurer la qualité n'est pas facile et requiert un investissement significatif en infrastructure.

Journalisation détaillée des traces

Le cœur de la logique de votre application RAG est une série d'étapes dans la chaîne. Pour évaluer et déboguer la qualité, vous devez implémenter une instrumentation qui suit les entrées et les sorties de la chaîne, ainsi que chaque étape de la chaîne, et ses entrées et sorties associées. L'instrumentation que vous mettez en place devrait fonctionner de la même manière en développement et en production.

Dans Databricks, MLflow Tracing offre cette fonctionnalité. Avec MLflow Trace Logging, vous instrumentez votre code en production, et obtenez les mêmes traces pendant le développement et en production. Les traces de production sont enregistrées dans le cadre de la table d'inférence.

Interface utilisateur de révision des parties prenantes

Le plus souvent, en tant que développeur, vous n'êtes pas un expert du domaine concernant le contenu de l'application que vous développez. Afin de recueillir les commentaires d'experts humains qui peuvent évaluer la qualité des résultats de votre application, vous avez besoin d'une interface qui leur permette d'interagir avec les premières versions de l'application et de fournir des commentaires détaillés. De plus, vous avez besoin d'un moyen de charger des sorties d'application spécifiques pour que les parties prenantes en évaluent la qualité.

Cette interface doit suivre les sorties de l'application et les retours associés de manière structurée, en stockant la trace complète de l'application et les retours détaillés dans une table de données.

Dans Databricks, l'Agent Evaluation Review App offre cette capacité.

Cadre de métriques de qualité, de coût et de latence

Vous avez besoin d'un moyen de définir les métriques qui mesurent de manière exhaustive la qualité de chaque composant de votre chaîne et de l'application de bout en bout. Idéalement, le cadre fournirait une suite de métriques standard prêtes à l'emploi, en plus de prendre en charge la personnalisation, afin que vous puissiez ajouter des métriques qui testent des aspects spécifiques de la qualité, uniques à votre entreprise.

Dans Databricks, Agent Evaluation fournit une implémentation prête à l'emploi, utilisant des modèles de juge LLM hébergés, pour les métriques de qualité, de coût et de latence nécessaires.

Faisceau d'évaluation

Vous avez besoin d'un moyen d'obtenir rapidement et efficacement des sorties de votre chaîne pour chaque question de votre jeu d'évaluation, puis d'évaluer chaque sortie selon les métriques pertinentes. Ce mécanisme doit être aussi efficace que possible, puisque vous exécuterez l'évaluation après chaque expérimentation que vous essayez d'améliorer la qualité.

Dans Databricks, Agent Evaluation fournit un cadre d'évaluation qui est intégré à MLflow.

Gestion des jeux d'évaluation

Votre ensemble d'évaluation est un ensemble de questions vivant et évolutif que vous mettrez à jour de manière itérative tout au long du cycle de vie de développement et de production de votre application.

Dans Databricks, vous pouvez gérer votre ensemble d'évaluation comme une Table Delta. Lors de l'évaluation avec MLflow, MLflow enregistre automatiquement un instantané de la version du jeu d'évaluation utilisé.

Framework de suivi des Experimentation

Au cours du développement de votre application, vous ferez de nombreuses expérimentations différentes. Un framework de suivi d’Experimentation vous permet d’enregistrer chaque Experimentation et de suivre ses métriques par rapport à d’autres Experimentations.

Dans Databricks, MLflow offre des capacités de suivi des expérimentations.

Framework de paramétrage de chaînes

De nombreuses Experimentations que vous essayez vous obligent à maintenir le code de la chaîne constant tout en itérant sur les différents parameters utilisés par le code. Vous avez besoin d'un framework qui vous permette de faire cela.

Dans Databricks, la configuration de modèle MLflow offre ces capacités.

Online monitoring

Une fois déployé, vous avez besoin d'un moyen de surveiller la santé de l'application ainsi que sa qualité, son coût et sa latence continus.

Dans Databricks, Model Serving assure le monitoring de l'état de santé des applications, et le profilage des données fournit des résultats continus à un tableau de bord et surveille la qualité, le coût et la latence.