Aller au contenu principal

Déployer des modèles avec Model Serving

Cet article décrit Model Serving, la solution Databricks pour le déploiement de modèles d'IA et de ML pour la diffusion en temps réel et l'inférence par batch.

Qu'est-ce que Model Serving ?

Model Serving fournit une interface unifiée pour déployer, gouverner et query les modèles d'IA pour l'inférence en temps réel et par batch. Chaque modèle que vous déployez est disponible en tant qu'API REST que vous pouvez intégrer dans votre application web ou cliente.

Model Serving fournit un service hautement disponible et à faible latence pour le déploiement de modèles. Le service monte ou descend en charge automatiquement pour répondre aux changements de la demande, ce qui permet d'économiser les coûts d'infrastructure tout en optimisant les performances en matière de latence. Cette fonctionnalité utilise le compute serverless. Consultez la page de tarifs de Model Serving pour plus de détails.

Model Serving offre une API REST unifiée et une API de déploiement MLflow pour les tâches CRUD et de requête. De plus, elle fournit une interface utilisateur unique pour gérer tous vos modèles et leurs Endpoint de Model Serving respectifs. Vous pouvez également accéder aux modèles directement depuis SQL en utilisant les AI Functions pour une intégration facile dans les workflows d'analytique.

AI Functions et Model Serving sont étroitement intégrées pour les scénarios d’inférence par lots. Vous pouvez utiliser l’une des AI Functions spécifiques à la tâche ou ai-query dans vos pipelines d’inférence par lots. Si vous choisissez d’utiliser un modèle pré-provisionné qui est hébergé et géré par Databricks, vous n’avez pas besoin de configurer vous-même un Endpoint de Model Serving.

Consultez les guides suivants pour start :

Modèles que vous pouvez déployer

La mise à disposition des modèles prend en charge l'inférence en temps réel et par batch pour les types de modèles suivants :

  • Modèles personnalisés. Ce sont des modèles Python empaquetés au format MLflow. Ils peuvent être enregistrés soit dans Unity Catalog, soit dans le registre de modèles de l'Workspace. Les exemples incluent scikit-learn, XGBoost, PyTorch et les modèles de transformateurs Hugging Face.

  • Modèles de fondation.

    • Les modèles de fondation hébergés par Databricks comme Meta Llama. Ces modèles sont disponibles à l'aide des APIs. Ces modèles sont des architectures de modèles de fondation soigneusement sélectionnées qui prennent en charge l'inférence optimisée. Modèles de base, comme Meta-Llama-3.3-70B-Instruct, GTE-Large et Mistral-7B sont disponibles pour une utilisation immédiate avec une tarification au paiement par jeton , et les charges de travail qui nécessitent des garanties de performance et des variantes de modèles affinés peuvent être déployées avec un throughput provisionné .
    • Modèles de fondation hébergés en dehors de Databricks comme GPT-4 d'OpenAI. Ces modèles sont accessibles en utilisant Modèles externes. Les Endpoints qui servent ces modèles peuvent être régis de manière centralisée à partir de Databricks, ce qui vous permet de rationaliser l'utilisation et la gestion de divers fournisseurs de LLM, tels qu'OpenAI et Anthropic, au sein de votre organisation.
remarque

Vous pouvez interagir avec des grands modèles linguistiques pris en charge en utilisant l'AI Playground. L'AI Playground est un environnement de type chat où vous pouvez tester, solliciter et comparer des LLM. Cette fonctionnalité est disponible dans votre Workspace Databricks.

Pourquoi utiliser Model Serving ?

  • Déployez et interrogez tous les modèles : Model Serving fournit une interface unifiée qui vous permet de gérer tous les modèles à un seul endroit et de les interroger avec une seule API, qu'ils soient hébergés sur Databricks ou en externe. Cette approche simplifie le processus d'Experimentation, de personnalisation et de déploiement de modèles en production sur divers cloud et fournisseurs.

  • Personnalisez les modèles en toute sécurité avec vos données privées : Conçu sur une plateforme Data Intelligence, Model Serving simplifie l’intégration des fonctionnalités et des embeddings dans les modèles grâce à une intégration native avec le Magasin de fonctionnalités Databricks et AI Search. Pour une précision et une compréhension contextuelle encore améliorées, les modèles peuvent être affinés avec des données propriétaires et déployés sans effort sur Model Serving.

  • Gérer et superviser les modèles : l’interface utilisateur de service vous permet de gérer de manière centralisée tous les endpoints de modèle au même endroit, y compris ceux qui sont hébergés en externe. Vous pouvez gérer les autorisations, suivre et définir des limites d’utilisation et surveiller la qualité de tous les types de modèles à l’aide de AI Gateway. Cela vous permet de démocratiser l'accès aux SaaS et aux LLM ouverts au sein de votre organisation tout en garantissant la mise en place de garde-fous appropriés.

  • **Réduisez les coûts grâce à une inférence optimisée et une mise à l'échelle rapide** : Databricks a mis en œuvre une série d'optimisations pour vous assurer d'obtenir le meilleur throughput et la meilleure latence pour les grands modèles. Les Endpoints montent ou descendent automatiquement en charge pour répondre aux changements de demande, ce qui permet d'économiser les coûts d'infrastructure tout en optimisant les performances de latence. Surveiller les coûts de mise à disposition de modèles.

    • Pour les charges de travail qui sont sensibles à la latence ou qui impliquent un nombre élevé de queries par seconde, consultez Optimiser les Endpoints de Model Serving pour la production pour des stratégies d'optimisation complètes. Contactez l'équipe de votre compte Databricks pour vous assurer que votre Workspace est activé pour une haute évolutivité.
  • **Apportez fiabilité et sécurité au Model Serving** : le Model Serving est conçu pour une utilisation en production à haute disponibilité et à faible latence et peut prendre en charge plus de 25 000 requêtes par seconde avec une latence supplémentaire de moins de 50 ms. Les charges de travail de diffusion sont protégées par plusieurs couches de sécurité, garantissant un environnement sécurisé et fiable même pour les tâches les plus sensibles. Vous pouvez contrôler l'accès réseau aux endpoints Model Serving en configurant des politiques réseau. Consultez Gérer les stratégies réseau pour le contrôle de sortie Serverless.

remarque

Model Serving ne fournit pas de correctifs de sécurité aux images de modèle existantes en raison du risque de déstabilisation des déploiements de production. Une nouvelle image de modèle créée à partir d'une nouvelle version de modèle contiendra les derniers correctifs. Contactez votre équipe de compte Databricks pour plus d'informations.

Exigences

Activez Model Serving pour votre Workspace

Pour utiliser Model Serving, votre administrateur de compte doit lire et accepter les conditions générales d’activation du compute serverless dans la console du compte.

remarque

Si votre compte a été créé après le 28 mars 2022, le compute Serverless est activé par default pour vos workspaces.

Si vous n'êtes pas administrateur de compte, vous ne pouvez pas effectuer ces étapes. Contactez un administrateur de compte si votre Workspace a besoin d'accéder au compute Serverless.

  1. En tant qu'administrateur de compte, accédez à l'tab d'activation des fonctionnalités de la page des paramètres de la console du compte.
  2. Une bannière en haut de la page vous invite à accepter les conditions supplémentaires. Une fois que vous avez lu les conditions, cliquez sur Accepter . Si vous ne voyez pas la bannière vous invitant à accepter les conditions, cette étape a déjà été effectuée.

Après que vous avez accepté les conditions, votre compte est activé pour le serverless.

Aucune étape supplémentaire n'est requise pour activer Model Serving dans votre workspace.

Limitations et disponibilité régionale

Model Serving impose des limites default pour garantir des performances fiables. Consultez Limites et régions de Model Serving. Si vous avez des commentaires sur ces limites ou un Endpoint dans une région non prise en charge, contactez l’équipe de votre compte Databricks.

Protection des données dans Model Serving

Databricks prend la sécurité des données au sérieux. Databricks comprend l'importance des données que vous analysez à l'aide de Model Serving et met en œuvre les contrôles de sécurité suivants pour protéger vos données.

  • Chaque requête client vers Model Serving est isolée logiquement, authentifiée et autorisée.
  • Model Serving chiffre toutes les données au repos (AES-256) et en transit (TLS 1.2+).

Pour tous les comptes payants, Model Serving n'utilise pas les entrées utilisateur soumises au service ou les sorties du service pour entraîner des modèles ou améliorer des services Databricks.

Les APIs de Modèles de fondation sont un service désigné de Databricks, ce qui signifie qu'elles respectent les limites de résidence des données telles qu'implémentées par Databricks Geos.

Conservation des données

Pour toutes les charges de travail Model Serving, Databricks conserve les logs de création de conteneurs pendant une durée maximale de trente (30) jours et les données de métriques pendant une durée maximale de quatorze (14) jours.

Pour les API de modèle de fondation Databricks, dans le cadre de la fourniture du service, Databricks peut temporairement traiter et stocker les entrées et les sorties afin de prévenir, détecter et atténuer les abus ou les utilisations nuisibles. Vos entrées et sorties sont isolées de celles des autres clients, stockées dans la même région que votre Workspace pour une durée maximale de trente (30) jours, et accessibles uniquement pour la détection et la réponse aux problèmes de sécurité ou d'abus.

Conservation des données des fournisseurs de modèles partenaires.

Les fournisseurs de modèles partenaires peuvent conserver les données à des fins de sécurité. Cette rétention repose sur l’analyse automatisée avant tout examen humain limité.

Conservation des données OpenAI

Conformément à la politique publique de rétention de la sécurité d'OpenAI, pour gpt-5.5, gpt-5.5-proet les futurs modèles, OpenAI peut conserver certains contenus client de routage et de codage que les classificateurs d'OpenAI détectent comme potentiellement en violation des politiques d'utilisation d'OpenAI lors de l'utilisation de ces modèles. Sinon, la rétention ne sera pas affectée.

Les clients de codage et de routage sont des clients qui :

  1. Fournir des services d'ingénierie logicielle ou de déploiement à des tiers, par exemple, la génération de code, la complétion de code et les workflows de développement/déploiement agentiques
  2. Agir en tant que plateformes ou services intermédiaires d’accès aux modèles qui permettent à des tiers d’utiliser les modèles OpenAI pour le développement de logiciels pertinents pour le cyber-risque, parallèlement à l’accès aux modèles d’autres fournisseurs.

Pour tous les autres clients, vous pouvez être soumis à une rétention supplémentaire moyennant un préavis.

Conservation des données Anthropic

Pour Fable 5 d'Anthropic et les futurs modèles de classe Mythos, tous les clients sont soumis à la conservation des données à des fins de sécurité, tel que décrit dans les pratiques de conservation des données d'Anthropic.

Ressources supplémentaires