Aller au contenu principal

Databricks Foundation Model APIs

Cet article fournit une présentation des APIs de modèle de fondation sur Databricks. Il inclut les exigences d'utilisation, les modèles pris en charge et les limitations.

Que sont les API Foundation Model Databricks ?​

Model Serving prend désormais en charge les APIs des modèles de fondation qui vous permettent d'accéder et d'interroger des modèles ouverts de pointe à partir d'un endpoint de déploiement. Ces modèles sont hébergés par Databricks et vous pouvez créer rapidement et facilement des applications qui les utilisent sans maintenir votre propre déploiement de modèle. Les APIs de modèles de fondation sont un Service Désigné Databricks, ce qui signifie qu'elles utilisent Databricks Geos pour gérer la résidence des données lors du traitement du contenu des clients.

Les Foundation Model APIs sont fournies dans les modes suivants :

  • Paiement par jeton : c'est le moyen le plus simple de start à accéder aux modèles de fondation sur Databricks et est recommandé pour start votre parcours avec les APIs de modèle de fondation. Pour les charges de travail de production, Databricks recommande le paiement par jeton prioritaire, également appelé mode Priorité, pour les charges de travail sensibles à la latence qui nécessitent des performances plus constantes sous charge.

  • Throughput provisionné : Ce mode est recommandé pour tous les workloads de production, en particulier ceux qui nécessitent un throughput élevé, des garanties de performance, des modèles affinés ou qui ont des exigences de sécurité supplémentaires. Les Endpoint de throughput provisionné sont disponibles avec des certifications de conformité comme HIPAA.

  • Modèles optimisés par AI Functions : ce mode est recommandé pour les charges de travail d'inférence par batch. Vous pouvez choisir d'exécuter l'inférence par batch à l'aide de n'importe quel modèle d'IA ou de ML, et ce, avec AI Functions.

Pour obtenir des conseils sur l’utilisation de ces modes et des modèles pris en charge, consultez la page Utiliser les APIs du modèle de fondation.

En utilisant les APIs de modèle de fondation, vous pouvez faire ce qui suit :

  • Query un LLM généralisé pour vérifier la validité d'un projet avant d'investir davantage de Ressources.
  • Interrogez un LLM généralisé pour créer une preuve de concept rapide pour une application basée sur un LLM avant d'investir dans la formation et le déploiement d'un modèle personnalisé.
  • Utilisez un modèle de fondation, avec un index vectoriel, pour créer un chatbot utilisant la génération augmentée par récupération (RAG).
  • Remplacez les modèles propriétaires par des alternatives ouvertes afin d'optimiser les coûts et les performances.
  • Comparez efficacement les LLM pour trouver le meilleur candidat pour votre cas d'usage, ou remplacez un modèle de production par un modèle plus performant.
  • Créez une application LLM pour le développement ou la production, s'appuyant sur une solution de service LLM évolutive et couverte par un accord de niveau de service (SLA), capable de prendre en charge vos pics de trafic de production.

Exigences​

Utiliser les APIs Foundation Model​

Vous disposez de plusieurs options pour l'utilisation des APIs Foundation Model.

La plupart des APIs de modèles de fondation sont compatibles avec OpenAI ; vous pouvez donc utiliser le client OpenAI pour les requêtes. Vous pouvez également utiliser l'interface utilisateur, le SDK Python des APIs Foundation Models, le SDK MLflow Deployments ou l'API REST pour interroger les modèles pris en charge. Les modèles OpenJev utilisent l'API TypeSafe System One. Databricks recommande d'utiliser le SDK client ou l'API OpenAI pour les interactions prolongées avec les modèles compatibles, et l'interface utilisateur pour tester la fonctionnalité.

Consultez Utiliser des modèles de fondation pour des exemples de notation.

APIs de modèles de fondation avec paiement à l’utilisation​

Des endpoints préconfigurés qui desservent les modèles pay-per-token sont accessibles dans votre workspace Databricks. Ces modèles de paiement au jeton sont recommandés pour getting start. Pour y accéder dans votre workspace, cliquez sur Passerelle IA dans la barre latérale du workspace. Les modèles de paiement au jeton sont répertoriés sous l’onglet Models en tant que services de modèle fournis par le système. Voir Services de modèle fournis par le système.

Liste des Endpoint de mise en service

Paiement par jeton prioritaire​

Le paiement par jeton prioritaire, également appelé mode Priorité, est une fonctionnalité de paiement par jeton pour les applications sensibles à la latence et en temps réel. Lorsque vous envoyez une requête avec le parameter service_tier défini sur "priority", Databricks admet la requête avant le trafic de paiement par jeton standard au mieux pour une latence plus constante sous charge. Le mode Priorité est optionnel par requête, ne requiert aucun engagement et est facturé à un tarif par jeton plus élevé.

Consultez Paiement par jeton prioritaire pour les APIs de modèle de fondation.

APIs de modèles de fondation avec throughput provisionné​

Le throughput provisionné fournit des endpoints avec une inférence optimisée pour les charges de travail de modèles de fondation qui nécessitent des garanties de performance. Databricks recommande le throughput provisionné pour les charges de travail de production.

Le support du throughput provisionné comprend :

  • Modèles de base de toutes tailles . Les modèles de base sont accessibles via Databricks Marketplace, ou vous pouvez également les download depuis Hugging Face ou une autre source externe et les enregistrer dans Unity Catalog. Cette dernière approche fonctionne avec toute variante affinée des modèles pris en charge.
  • Variantes affinées des modèles de base , telles que les modèles affinés sur des données propriétaires.
  • Poids et tokeniseurs entièrement personnalisés , tels que ceux entraînés à partir de zéro ou pré-entraînés en continu ou d' autres variantes utilisant l'architecture de modèle de base (par exemple, CodeLlama).

AI Functions pour l'inférence par batch​

Voir Transformer des données non structurées à l'aide d'AI Functions.

Consultez Déployer des pipelines d'inférence par batch pour découvrir comment créer des pipelines d'inférence par batch à l'aide d'AI Functions.

Limitations​

Consultez les limites des APIs de modèle de fondation.

Ressources supplémentaires​