Utiliser des modèles de fondation
Dans cet article, vous apprendrez quelles options sont disponibles pour rédiger des requêtes de query pour les modèles de fondation et comment les envoyer à votre endpoint de service de modèles. Vous pouvez interroger les modèles de fondation hébergés par Databricks et les modèles de fondation hébergés en dehors de Databricks.
Pour les requêtes de query de modèles ML ou Python traditionnels, consultez Endpoint de service de query pour les modèles personnalisés.
Model Serving prend en charge les Foundation Models APIs et les modèles externes pour accéder aux modèles de fondation. Model Serving utilise une API et un SDK unifiés compatibles avec OpenAI pour les interroger. Cela permet d'expérimenter et de personnaliser les modèles de fondation pour la production sur l'ensemble des clouds et fournisseurs pris en charge.
Les requêtes adressées aux modèles de fondation, hébergés par Databricks ou externes, sont acheminées via Unity AI Gateway (Bêta), ce qui vous permet d'appliquer des limites de débit, des budgets et des garde-fous pour contrôler les coûts et l'accès.
Options de query
Model Serving offre les options suivantes pour l'envoi de requêtes query aux Endpoints qui servent des modèles de fondation :
Méthode | Détails |
|---|---|
Client OpenAI | Interrogez un modèle hébergé par un endpoint de Model Serving à l'aide du client OpenAI. Spécifiez le nom de l'endpoint de mise en service du modèle comme entrée |
Fonctions IA | Invoquez l'inférence de modèle directement depuis SQL en utilisant la fonction SQL |
Interface utilisateur de service | Sélectionnez Endpoint de query dans la page Endpoint de service . Insérez les données d'entrée du modèle au format JSON et cliquez sur Envoyer la demande . Si le modèle a un exemple d'entrée journalisé, utilisez Afficher l'exemple pour le charger. |
API REST | Appelez et interrogez le modèle à l'aide de l'API REST. Voir POST /serving-endpoints/{name}/invocations pour plus de détails. Pour les requêtes de scoring vers des endpoints diffusant plusieurs modèles, voir Interroger des modèles individuels derrière un endpoint. |
SDK de déploiements MLflow | Utilisez la fonction predict() du SDK de déploiement MLflow pour interroger le modèle. |
Databricks Python SDK | Le SDK Python de Databricks est une couche au-dessus de l'API REST. Il gère les détails de bas niveau, tels que l'authentification, ce qui facilite l'interaction avec les modèles. |
Exigences
-
Un Databricks Workspace dans une région prise en charge.
-
Pour envoyer une demande de scoring via le client OpenAI, l'API REST ou le SDK de déploiement MLflow, vous devez disposer d'un jeton API Databricks.
En tant que bonne pratique de sécurité pour les scénarios de production, Databricks vous recommande d'utiliser des jetons OAuth machine à machine pour l'authentification pendant la production.
Pour les tests et le développement, Databricks recommande d'utiliser un jeton d'accès personnel appartenant aux Service Principals au lieu des utilisateurs de Workspace. Pour créer des jetons pour les Service Principals, consultez Gérer les jetons pour un Service Principal.
Installer les packages
Après avoir sélectionné une méthode de query, vous devez d'abord installer le package approprié sur votre cluster.
- OpenAI client
- REST API
- MLflow Deployments SDK
- Databricks Python SDK
Pour utiliser le client OpenAI, le package databricks-openai doit être installé sur votre cluster. Ce package fournit un client OpenAI avec une autorisation configurée automatiquement pour query les modèles d'IA générative. Exécutez l'élément suivant dans votre notebook ou votre terminal local :
pip install -U databricks-openai
Ceci n'est requis que lors de l'installation du package sur un Notebook Databricks.
dbutils.library.restartPython()
L'accès à l'API REST de Serving est disponible dans Databricks Runtime for Machine Learning.
!pip install mlflow
Ceci n'est requis que lors de l'installation du package sur un Notebook Databricks.
dbutils.library.restartPython()
Le Databricks SDK pour Python est déjà installé sur tous les clusters Databricks qui utilisent Databricks Runtime 13.3 LTS et versions ultérieures. Pour les clusters Databricks qui utilisent Databricks Runtime 12,2 LTS et les versions antérieures, vous devez d'abord installer le Databricks SDK pour Python. Consultez le Databricks SDK pour Python.
Types de modèles de fondation
Le tableau suivant résume les modèles de fondation pris en charge en fonction du type de tâche.
Meta-Llama-3.1-405B-Instruct sera retiré,
- À partir du 15 février 2026 pour les charges de travail avec paiement par jeton.
- À partir du 15 mai 2026 pour les charges de travail à throughput provisionné.
Consultez les modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et les instructions de migration pendant la dépréciation.
Type de tâche | Description | Modèles pris en charge | Quand l'utiliser ? Cas d'utilisation recommandés |
|---|---|---|---|
Modèles conçus pour comprendre et participer à des conversations naturelles à plusieurs tours. Ils sont affinés sur de grands datasets de dialogue humain, ce qui leur permet de générer des réponses contextuellement pertinentes, de suivre l'historique des conversations et de fournir des interactions cohérentes, semblables à celles des humains, sur divers sujets. | Voici les modèles de fondation pris en charge hébergés par Databricks :
Les modèles externes pris en charge sont :
| Recommandé pour les scénarios où un dialogue naturel à plusieurs tours et une compréhension contextuelle sont nécessaires :
| |
Les modèles d'intégration sont des systèmes de Machine Learning qui transforment des données complexes — telles que du texte, des images ou de l'audio — en vecteurs numériques compacts appelés intégrations. Ces vecteurs saisissent les caractéristiques essentielles et les relations au sein des données, permettant une comparaison, un clustering et une recherche sémantique efficaces. | Voici les modèles de fondation hébergés par Databricks pris en charge : Les modèles externes pris en charge sont :
| Recommandé pour les applications où la compréhension sémantique, la comparaison de similarité et la récupération ou le clustering efficace de données complexes sont essentiels :
| |
Modèles conçus pour traiter, interpréter et analyser les données visuelles — comme les images et les vidéos, afin que les machines puissent « voir » et comprendre le monde visuel. | Voici les modèles de fondation pris en charge hébergés par Databricks :
Les modèles externes pris en charge sont :
| Recommandé partout où une analyse automatisée, précise et évolutive des informations visuelles est nécessaire :
| |
Systèmes d'IA avancés conçus pour simuler une pensée logique de type humain. Les modèles de raisonnement intègrent des techniques telles que la logique symbolique, le raisonnement probabiliste et les réseaux de neurones pour analyser le contexte, décomposer les tâches et expliquer leur prise de décision. | Voici les modèles de fondation hébergés par Databricks pris en charge :
Les modèles externes pris en charge sont :
| Recommandé partout où une analyse automatisée, précise et évolutive des informations visuelles est nécessaire :
|
Appel de fonction
Databricks Function Calling est compatible OpenAI et est uniquement disponible pendant le déploiement de modèles dans le cadre des API de modèle de fondation et des endpoints de déploiement qui servent des modèles externes. Pour en savoir plus, consultez l’appel de fonction sur Databricks.
Sorties structurées
Les sorties structurées sont compatibles avec OpenAI et sont uniquement disponibles lors du service de modèle dans le cadre des APIs de modèle de fondation. Pour plus de détails, consultez les sorties structurées sur Databricks.
Mise en cache des prompts
La mise en cache des invites est prise en charge pour les modèles Claude hébergés par Databricks dans le cadre des APIs de modèle de fondation.
Vous pouvez spécifier le cache_control parameter dans vos query requests pour mettre en cache ce qui suit :
- Messages de contenu textuel dans le tableau
messages.content. - Contenu des messages dans le tableau
messages.content. - Blocs de contenu d'images dans le tableau
messages.content. - Utilisation des outils, résultats et définitions dans le tableau
tools.
Consultez la référence de l'API REST des modèles de fondation.
- TextContent
- ReasonContent
- ImageContent
- ToolCallContent
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What's the date today?",
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
{
"messages": [
{
"role": "assistant",
"content": [
{
"type": "reasoning",
"summary": [
{
"type": "summary_text",
"text": "Thinking...",
"signature": "[optional]"
},
{
"type": "summary_encrypted_text",
"data": "[encrypted text]"
}
]
}
]
}
]
}
Le contenu du message de l'image doit utiliser les données encodées comme source. Les URL ne sont pas prises en charge.
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What’s in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "data:image/jpeg;base64,[content]"
},
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
{
"messages": [
{
"role": "assistant",
"content": "Ok, let’s get the weather in New York.",
"tool_calls": [
{
"type": "function",
"id": "123",
"function": {
"name": "get_weather",
"arguments": "{\"location\":\"New York, NY\"}"
},
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
L'API REST de Databricks est compatible avec OpenAI et diffère de l'API Anthropic. Ces différences ont également un impact sur les objets de réponse comme les suivants :
- La sortie est renvoyée dans le champ
choices. - Format de segment streaming. Tous les segments adhèrent au même format où
choicescontient la réponsedeltaet l'utilisation est renvoyée dans chaque segment. - Le motif de l'arrêt est renvoyé dans le champ
finish_reason.- Anthropic utilise :
end_turn,stop_sequence,max_tokens, ettool_use - Respectivement, Databricks utilise :
stop,stop,lengthettool_calls
- Anthropic utilise :
Discutez avec des LLM pris en charge à l'aide d'AI Playground.
Vous pouvez interagir avec des grands modèles linguistiques pris en charge en utilisant l'AI Playground. L'AI Playground est un environnement de chat où vous pouvez tester, créer des prompts et comparer des LLM depuis votre Workspace Databricks.

Ressources supplémentaires
- Surveiller les modèles servis à l'aide de tables d'inférence compatibles avec AI Gateway
- Déployer des pipelines d'inférence par batch
- Databricks Foundation Model APIs
- Modèles externes dans Model Serving
- Tutoriel : Créez des endpoints de modèle externe pour query les modèles OpenAI
- Modèles de fondation hébergés par Databricks disponibles dans les API de modèles de fondation
- Référence de l'API REST du modèle Foundation