Workflows LLMOps sur Databricks
Cet article complète les workflows MLOps sur Databricks en ajoutant de l'information spécifique aux workflows LLMOps. Pour plus de détails, consultez Le Grand Livre des MLOps.
Comment le workflow MLOps évolue-t-il pour les LLM ?
Les LLM sont une classe de modèles de traitement du langage naturel (TLN) qui ont considérablement surpassé leurs prédécesseurs en taille et en performances dans une variété de tâches, telles que la réponse aux questions ouvertes, la synthèse et l'exécution d'instructions.
Le développement et l'évaluation des LLM diffèrent à plusieurs égards importants des modèles ML traditionnels. Cette section résume brièvement certaines des propriétés clés des LLM et les implications pour le MLOps.
Propriétés clés des LLM | Implications pour MLOps |
|---|---|
Les LLM sont disponibles sous de nombreuses formes.
| Processus de développement : les projets se développent souvent de manière incrémentielle, en partant de modèles existants, tiers ou open source et en se terminant par des modèles personnalisés affinés. |
De nombreux LLM prennent en entrée des query et des instructions en langage naturel général. Ces query peuvent contenir des prompts soigneusement conçus pour susciter les réponses souhaitées. | Processus de développement : la conception de templates de texte pour interroger les LLM est souvent un élément important du développement de nouveaux pipelines LLM. Conditionnement des artefacts ML : de nombreux pipelines LLM utilisent des LLM existants ou des Endpoint de service LLM. La logique ML développée pour ces pipelines pourrait se concentrer sur les Template d'invite, les agents ou les chaînes plutôt que sur le modèle lui-même. Les artefacts ML packagés et promus en production pourraient être ces pipelines, plutôt que des modèles. |
De nombreux LLM peuvent recevoir des invites avec des exemples, un contexte ou d'autres informations pour aider à répondre à la query. | **Infrastructure de service :** Lorsque vous augmentez les query de LLM avec du contexte, vous pourriez utiliser des outils supplémentaires tels que des index vectoriels pour rechercher un contexte pertinent. |
Les APIs tierces fournissent des modèles propriétaires et open source. | Gouvernance des API : l'utilisation d'une gouvernance centralisée des API offre la possibilité de basculer facilement entre les fournisseurs d'API. |
Les LLM sont de très grands modèles de deep learning, dont la taille varie souvent de quelques gigaoctets à des centaines de gigaoctets. | **Infrastructure de service :** les LLM peuvent nécessiter des GPU pour le service de modèles en temps réel, et un stockage rapide pour les modèles qui doivent être chargés dynamiquement. Compromis coût/performances : étant donné que les modèles plus grands nécessitent plus de calcul et sont plus coûteux à servir, des techniques de réduction de la taille et du calcul du modèle peuvent être nécessaires. |
Les LLM sont difficiles à évaluer à l'aide de métriques ML traditionnelles, car il n'existe souvent pas de « bonne » réponse unique. | Feedback humain : Le feedback humain est essentiel pour l'évaluation et le test des LLM. Vous devez incorporer les commentaires des utilisateurs directement dans le processus MLOps, y compris pour les tests, le monitoring et l'affinement futur. |
Points communs entre MLOps et LLMOps
De nombreux aspects des processus MLOps restent inchangés pour les LLM. Par exemple, les lignes directrices suivantes s'appliquent également aux LLM :
- Utilisez des environnements distincts pour le développement, la préproduction et la production.
- Utilisez Git pour le contrôle de version.
- Gérez le développement de modèles avec MLflow, et utilisez les modèles dans Unity Catalog pour gérer le cycle de vie des modèles.
- Stockez les données dans une architecture lakehouse à l'aide de tables Delta.
- Votre infrastructure CI/CD existante ne devrait nécessiter aucune modification.
- La structure modulaire de MLOps reste la même, avec des pipelines pour la featurization, l'entraînement de modèles, l'inférence de modèles, etc.
Schémas d’architecture de référence
Cette section utilise deux applications basées sur le LLM pour illustrer certains des ajustements apportés à l'architecture de référence du MLOps traditionnel. Les diagrammes montrent l'architecture de production pour 1) une application de génération augmentée de récupération (RAG) utilisant une API tierce, et 2) une application RAG utilisant un modèle affiné auto-hébergé. Les deux diagrammes montrent une base de données vectorielle facultative — cet élément peut être remplacé en interrogeant directement le LLM via l’Endpoint de Model Serving.
RAG avec une API LLM tierce
Le diagramme montre une architecture de production pour une application RAG qui se connecte à une API LLM tierce à l'aide de Databricks External Models.

RAG avec un modèle open source affiné
Le diagramme présente une architecture de production pour une application RAG qui affine un modèle open source.

LLMOps passe à l'architecture de production MLOps
Cette section met en évidence les changements majeurs apportés à l'architecture de référence MLOps pour les applications LLMOps.
Hub de modèle
Les applications LLM utilisent souvent des modèles existants et pré-entraînés sélectionnés à partir d'un hub de modèles interne ou externe. Le modèle peut être utilisé tel quel ou affiné.
Databricks inclut une sélection de modèles de base de haute qualité, pré-entraînés dans Unity Catalog et dans Databricks Marketplace. Vous pouvez utiliser ces modèles pré-entraînés pour accéder à des fonctionnalités d'IA de pointe, ce qui vous fait économiser le temps et les dépenses liés à la création de vos propres modèles personnalisés. Pour plus de détails, consultez Accéder aux modèles d'IA générative et de LLM depuis Unity Catalog.
Index vectoriel
Certaines applications LLM utilisent des index vectoriels pour des recherches de similarité rapides, par exemple pour apporter du contexte ou des connaissances spécifiques au domaine dans les requêtes LLM. Databricks fournit une fonctionnalité de recherche IA intégrée qui vous permet d'utiliser n'importe quelle table Delta dans Unity Catalog comme index. L'index de recherche IA se synchronise automatiquement avec la table Delta. Pour plus de détails, consultez Recherche IA.
Vous pouvez créer un artefact de modèle qui encapsule la logique de récupération des informations d'un index de recherche AI et fournit les données renvoyées comme contexte au LLM. Vous pouvez ensuite enregistrer le modèle en utilisant la variante de modèle MLflow LangChain ou PyFunc.
Affiner LLM
Parce que les modèles LLM sont coûteux et longs à créer à partir de zéro, les applications LLM affinent souvent un modèle existant pour améliorer ses performances dans un scénario particulier. Dans l'architecture de référence, l'affinement et le déploiement de modèles sont représentés comme des Lakeflow Jobs distincts. La validation d'un modèle affiné avant le déploiement est souvent un processus manuel.
Databricks propose l'affinement de modèles de fondation, ce qui vous permet d'utiliser vos propres données pour personnaliser un LLM existant afin d'optimiser ses performances pour votre application spécifique. Pour plus de détails, consultez affinement du modèle de fondation.
Mise à disposition de modèles
Dans le scénario RAG utilisant une API tierce, un changement architectural important est que le pipeline LLM effectue des appels d'APIs externes, du Model Serving Endpoint vers des APIs LLM internes ou tierces. Cela ajoute de la complexité, une latence potentielle et une gestion supplémentaire des identifiants.
Databricks fournit Model Serving, qui offre une interface unifiée pour déployer, gouverner et query des modèles d'IA. Pour plus de détails, consultez Model Serving.
Feedback humain dans le monitoring et l'évaluation
Les boucles de rétroaction humaines sont essentielles dans la plupart des applications LLM. Le feedback humain doit être géré comme les autres données, idéalement intégré au monitoring basé sur le streaming en quasi temps réel.
L’application d’évaluation MLflow vous aide à recueillir les commentaires des réviseurs humains. Pour plus de détails, consultez le feedback humain dans MLflow.