Utiliser des modèles de fondation
Dans cet article, vous apprendrez quelles options sont disponibles pour rédiger des requêtes de query pour les modèles de fondation et comment les envoyer à votre endpoint de service de modèles. Vous pouvez interroger les modèles de fondation hébergés par Databricks et les modèles de fondation hébergés en dehors de Databricks.
Si vous débutez et souhaitez appeler un LLM, utilisez les API de modèle (services de modèle) dans Unity Gateway. Les services de modèle vous offrent un accès gouverné aux modèles de fondation servis en mode natif par Databricks via une interface unique, sans avoir à configurer de Endpoint de service. Pour commencer à interroger des LLM, consultez Get start querying LLMs on Databricks. Utilisez les options de query de Endpoint de service ci-dessous lorsque vous envoyez des demandes aux Endpoint que vous hébergez vous-même.
Pour les requêtes de query de modèles ML ou Python traditionnels, consultez Endpoint de service de query pour les modèles personnalisés.
Model Serving prend en charge les Foundation Models APIs et les modèles externes pour accéder aux modèles de fondation. Model Serving utilise une API et un SDK unifiés compatibles avec OpenAI pour les interroger. Cela permet d'expérimenter et de personnaliser les modèles de fondation pour la production sur l'ensemble des clouds et fournisseurs pris en charge.
Les requêtes vers les modèles de fondation, qu’ils soient hébergés par Databricks ou externes, sont acheminées via Unity Gateway, ce qui vous permet d’appliquer des limites de débit, des budgets et des mesures de protection pour contrôler les coûts et l’accès.
Options de query
Model Serving offre les options suivantes pour l'envoi de requêtes query aux Endpoints qui servent des modèles de fondation :
Méthode | Détails |
|---|---|
Client OpenAI | Interrogez un modèle hébergé par un endpoint de Model Serving à l'aide du client OpenAI. Spécifiez le nom de l'endpoint de mise en service du modèle comme entrée |
Fonctions IA | Invoquez l'inférence de modèle directement depuis SQL en utilisant la fonction SQL |
Interface utilisateur de service | Sélectionnez Endpoint de query dans la page Endpoint de service . Insérez les données d'entrée du modèle au format JSON et cliquez sur Envoyer la demande . Si le modèle a un exemple d'entrée journalisé, utilisez Afficher l'exemple pour le charger. |
API REST | Appelez et interrogez le modèle à l'aide de l'API REST. Voir POST /serving-endpoints/{name}/invocations pour plus de détails. Pour les requêtes de scoring vers des endpoints diffusant plusieurs modèles, voir Interroger des modèles individuels derrière un endpoint. |
SDK de déploiements MLflow | Utilisez la fonction predict() du SDK de déploiement MLflow pour interroger le modèle. |
Databricks Python SDK | Le SDK Python de Databricks est une couche au-dessus de l'API REST. Il gère les détails de bas niveau, tels que l'authentification, ce qui facilite l'interaction avec les modèles. |
Exigences
-
Un Databricks Workspace dans une région prise en charge.
-
Pour envoyer une demande de scoring via le client OpenAI, l'API REST ou le SDK de déploiement MLflow, vous devez disposer d'un jeton API Databricks.
En tant que bonne pratique de sécurité pour les scénarios de production, Databricks vous recommande d'utiliser des jetons OAuth machine à machine pour l'authentification pendant la production.
Pour les tests et le développement, Databricks recommande d'utiliser un jeton d'accès personnel appartenant aux Service Principals au lieu des utilisateurs de Workspace. Pour créer des jetons pour les Service Principals, consultez Gérer les jetons pour un Service Principal.
Installer les packages
Après avoir sélectionné une méthode de query, vous devez d'abord installer le package approprié sur votre cluster.
- OpenAI client
- REST API
- MLflow Deployments SDK
- Databricks Python SDK
Pour utiliser le client OpenAI, le package databricks-openai doit être installé sur votre cluster. Ce package fournit un client OpenAI avec une autorisation automatiquement configurée pour query les modèles d'IA. Exécutez ce qui suit dans votre notebook ou votre terminal local :
pip install -U databricks-openai
Ceci n'est requis que lors de l'installation du package sur un Notebook Databricks.
dbutils.library.restartPython()
L'accès à l'API REST de Serving est disponible dans Databricks Runtime for Machine Learning.
!pip install mlflow
Ceci n'est requis que lors de l'installation du package sur un Notebook Databricks.
dbutils.library.restartPython()
Le Databricks SDK pour Python est déjà installé sur tous les clusters Databricks qui utilisent Databricks Runtime 13.3 LTS et versions ultérieures. Pour les clusters Databricks qui utilisent Databricks Runtime 12,2 LTS et les versions antérieures, vous devez d'abord installer le Databricks SDK pour Python. Consultez le Databricks SDK pour Python.
Types de modèles de fondation
Le tableau suivant résume les modèles de fondation pris en charge en fonction du type de tâche.
Appel de fonction
Databricks Function Calling est compatible OpenAI et est uniquement disponible pendant le déploiement de modèles dans le cadre des API de modèle de fondation et des endpoints de déploiement qui servent des modèles externes. Pour en savoir plus, consultez l’appel de fonction sur Databricks.
Sorties structurées
Les sorties structurées sont compatibles avec OpenAI et sont uniquement disponibles lors du service de modèle dans le cadre des APIs de modèle de fondation. Pour plus de détails, consultez les sorties structurées sur Databricks.
Mise en cache des prompts
La mise en cache des invites est prise en charge pour les modèles Claude hébergés par Databricks dans le cadre des APIs de modèle de fondation.
Vous pouvez spécifier le cache_control parameter dans vos query requests pour mettre en cache ce qui suit :
- Messages de contenu textuel dans le tableau
messages.content. - Contenu des messages dans le tableau
messages.content. - Blocs de contenu d'images dans le tableau
messages.content. - Utilisation des outils, résultats et définitions dans le tableau
tools.
Consultez la référence de l'API REST des modèles de fondation.
- TextContent
- ReasonContent
- ImageContent
- ToolCallContent
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What's the date today?",
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
{
"messages": [
{
"role": "assistant",
"content": [
{
"type": "reasoning",
"summary": [
{
"type": "summary_text",
"text": "Thinking...",
"signature": "[optional]"
},
{
"type": "summary_encrypted_text",
"data": "[encrypted text]"
}
]
}
]
}
]
}
Le contenu du message de l'image doit utiliser les données encodées comme source. Les URL ne sont pas prises en charge.
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What’s in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "data:image/jpeg;base64,[content]"
},
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
{
"messages": [
{
"role": "assistant",
"content": "Ok, let’s get the weather in New York.",
"tool_calls": [
{
"type": "function",
"id": "123",
"function": {
"name": "get_weather",
"arguments": "{\"location\":\"New York, NY\"}"
},
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
L'API REST de Databricks est compatible avec OpenAI et diffère de l'API Anthropic. Ces différences ont également un impact sur les objets de réponse comme les suivants :
- La sortie est renvoyée dans le champ
choices. - Format de segment streaming. Tous les segments adhèrent au même format où
choicescontient la réponsedeltaet l'utilisation est renvoyée dans chaque segment. - Le motif de l'arrêt est renvoyé dans le champ
finish_reason.- Anthropic utilise :
end_turn,stop_sequence,max_tokens, ettool_use - Respectivement, Databricks utilise :
stop,stop,lengthettool_calls
- Anthropic utilise :
Discutez avec des LLM pris en charge à l'aide d'AI Playground.
Vous pouvez interagir avec des grands modèles linguistiques pris en charge en utilisant l'AI Playground. L'AI Playground est un environnement de chat où vous pouvez tester, créer des prompts et comparer des LLM depuis votre Workspace Databricks.

Ressources supplémentaires
- Enregistrer les requêtes et les réponses pour les Endpoint (hérité)
- Déployer des pipelines d'inférence par batch
- Databricks Foundation Model APIs
- Modèles externes dans Model Serving
- Tutoriel : Créez des endpoints de modèle externe pour query les modèles OpenAI
- Modèles de fondation hébergés par Databricks disponibles dans les API de modèles de fondation
- Référence de l'API REST du modèle Foundation