Databricks Foundation Model APIs
Cet article fournit une présentation des APIs de modèle de fondation sur Databricks. Il inclut les exigences d'utilisation, les modèles pris en charge et les limitations.
Que sont les API Foundation Model Databricks ?
Model Serving prend désormais en charge les APIs des modèles de fondation qui vous permettent d'accéder et d'interroger des modèles ouverts de pointe à partir d'un endpoint de déploiement. Ces modèles sont hébergés par Databricks et vous pouvez créer rapidement et facilement des applications qui les utilisent sans maintenir votre propre déploiement de modèle. Les APIs de modèles de fondation sont un Service Désigné Databricks, ce qui signifie qu'elles utilisent Databricks Geos pour gérer la résidence des données lors du traitement du contenu des clients.
Les Foundation Model APIs sont fournies dans les modes suivants :
- Paiement par jeton : c'est le moyen le plus simple de start à accéder aux modèles de fondation sur Databricks et est recommandé pour start votre parcours avec les APIs de modèle de fondation. Ce mode n'est pas conçu pour les applications à haut throughput, mais peut être utilisé pour les charges de travail de production.
- Throughput provisionné : Ce mode est recommandé pour tous les workloads de production, en particulier ceux qui nécessitent un throughput élevé, des garanties de performance, des modèles affinés ou qui ont des exigences de sécurité supplémentaires. Les Endpoint de throughput provisionné sont disponibles avec des certifications de conformité comme HIPAA.
- Modèles optimisés pour AI Functions : Ce mode est recommandé pour les charges de travail d'inférence par batch. Vous pouvez choisir d'exécuter l'inférence par batch en utilisant n'importe quel modèle d'IA générative ou de ML à l'aide des AI Functions.
Pour obtenir des conseils sur l’utilisation de ces modes et des modèles pris en charge, consultez la page Utiliser les APIs du modèle de fondation.
En utilisant les APIs de modèle de fondation, vous pouvez faire ce qui suit :
- Query un LLM généralisé pour vérifier la validité d'un projet avant d'investir davantage de Ressources.
- Interrogez un LLM généralisé pour créer une preuve de concept rapide pour une application basée sur un LLM avant d'investir dans la formation et le déploiement d'un modèle personnalisé.
- Utilisez un modèle de fondation, avec un index vectoriel, pour créer un chatbot utilisant la génération augmentée par récupération (RAG).
- Remplacez les modèles propriétaires par des alternatives ouvertes afin d'optimiser les coûts et les performances.
- Comparez efficacement les LLM pour trouver le meilleur candidat pour votre cas d'usage, ou remplacez un modèle de production par un modèle plus performant.
- Créez une application LLM pour le développement ou la production, s'appuyant sur une solution de service LLM évolutive et couverte par un accord de niveau de service (SLA), capable de prendre en charge vos pics de trafic de production.
Exigences
- Jeton d'API Databricks pour authentifier les requêtes d'Endpoint.
- Compute Serverless (pour les modèles de throughput provisionné).
- Un Workspace dans l'une des régions prises en charge suivantes :
Utiliser les APIs Foundation Model
Vous disposez de plusieurs options pour l'utilisation des APIs Foundation Model.
Les APIs sont compatibles avec OpenAI, vous pouvez donc utiliser le client OpenAI pour les requêtes. Vous pouvez également utiliser l'interface utilisateur, le SDK Python des API des modèles de fondation, le SDK de déploiement MLflow ou l'API REST pour interroger les modèles pris en charge. Databricks recommande d'utiliser le SDK client OpenAI ou l'API pour les interactions étendues et l'interface utilisateur pour essayer la fonctionnalité.
Consultez Utiliser des modèles de fondation pour des exemples de notation.
APIs de modèles de fondation avec paiement à l’utilisation
Les Endpoint préconfigurés qui servent les modèles de paiement par jeton sont accessibles dans votre Workspace Databricks. Ces modèles de paiement par jeton sont recommandés pour commencer. Pour y accéder dans votre Workspace, accédez à l'onglet Serving dans la barre latérale gauche. Les APIs Foundation Model sont situés en haut de la vue de liste des Endpoint.

- Modèles pris en charge du paiement par jeton.
- Consultez Utiliser des modèles de fondation pour obtenir des conseils sur la façon d'interroger les APIs de modèle de fondation.
- Consultez la référence de l'API REST de modèle de fondation pour connaître les paramètres et la syntaxe requis.
APIs de modèles de fondation avec throughput provisionné
Le throughput provisionné fournit des endpoints avec une inférence optimisée pour les charges de travail de modèles de fondation qui nécessitent des garanties de performance. Databricks recommande le throughput provisionné pour les charges de travail de production.
- Architectures de modèle prises en charge par le throughput provisionné.
- Consultez API des modèles de fondation à throughput provisionné pour un guide pas à pas sur la façon de déployer les API des modèles de fondation en mode throughput provisionné.
Le support du throughput provisionné comprend :
- Modèles de base de toutes tailles . Les modèles de base sont accessibles via Databricks Marketplace, ou vous pouvez également les download depuis Hugging Face ou une autre source externe et les enregistrer dans Unity Catalog. Cette dernière approche fonctionne avec toute variante affinée des modèles pris en charge.
- Variantes affinées des modèles de base , telles que les modèles affinés sur des données propriétaires.
- Poids et tokeniseurs entièrement personnalisés , tels que ceux entraînés à partir de zéro ou pré-entraînés en continu ou d' autres variantes utilisant l'architecture de modèle de base (par exemple, CodeLlama).
AI Functions pour l'inférence par batch
Consulter Enrichir des données en utilisant les AI Functions.
Consultez Déployer des pipelines d'inférence par batch pour découvrir comment créer des pipelines d'inférence par batch à l'aide d'AI Functions.
Limitations
Consultez les limites des APIs de modèle de fondation.