Aller au contenu principal

Utiliser des modèles de fondation

Dans cet article, vous apprendrez quelles options sont disponibles pour rédiger des requêtes de query pour les modèles de fondation et comment les envoyer à votre endpoint de service de modèles. Vous pouvez interroger les modèles de fondation hébergés par Databricks et les modèles de fondation hébergés en dehors de Databricks.

Pour les requêtes de query de modèles ML ou Python traditionnels, consultez Endpoint de service de query pour les modèles personnalisés.

Model Serving prend en charge les Foundation Models APIs et les modèles externes pour accéder aux modèles de fondation. Model Serving utilise une API et un SDK unifiés compatibles avec OpenAI pour les interroger. Cela permet d'expérimenter et de personnaliser les modèles de fondation pour la production sur l'ensemble des clouds et fournisseurs pris en charge.

remarque

Les requêtes adressées aux modèles de fondation, hébergés par Databricks ou externes, sont acheminées via Unity AI Gateway (Bêta), ce qui vous permet d'appliquer des limites de débit, des budgets et des garde-fous pour contrôler les coûts et l'accès.

Options de query

Model Serving offre les options suivantes pour l'envoi de requêtes query aux Endpoints qui servent des modèles de fondation :

Méthode

Détails

Client OpenAI

Interrogez un modèle hébergé par un endpoint de Model Serving à l'aide du client OpenAI. Spécifiez le nom de l'endpoint de mise en service du modèle comme entrée model. Pris en charge pour les modèles de chat, d'embeddings et de complétions mis à disposition par les APIs de modèle de fondation ou les modèles externes.

Fonctions IA

Invoquez l'inférence de modèle directement depuis SQL en utilisant la fonction SQL ai_query. Voir Exemple : Query un modèle de fondation.

Interface utilisateur de service

Sélectionnez Endpoint de query dans la page Endpoint de service . Insérez les données d'entrée du modèle au format JSON et cliquez sur Envoyer la demande . Si le modèle a un exemple d'entrée journalisé, utilisez Afficher l'exemple pour le charger.

API REST

Appelez et interrogez le modèle à l'aide de l'API REST. Voir POST /serving-endpoints/{name}/invocations pour plus de détails. Pour les requêtes de scoring vers des endpoints diffusant plusieurs modèles, voir Interroger des modèles individuels derrière un endpoint.

SDK de déploiements MLflow

Utilisez la fonction predict() du SDK de déploiement MLflow pour interroger le modèle.

Databricks Python SDK

Le SDK Python de Databricks est une couche au-dessus de l'API REST. Il gère les détails de bas niveau, tels que l'authentification, ce qui facilite l'interaction avec les modèles.

Méthode

Détails

Client OpenAI

Interrogez un modèle hébergé par un endpoint de Model Serving à l'aide du client OpenAI. Spécifiez le nom de l'endpoint de mise en service du modèle comme entrée model. Pris en charge pour les modèles de chat, d'embeddings et de complétions mis à disposition par les APIs de modèle de fondation ou les modèles externes.

Fonctions IA

Invoquez l'inférence de modèle directement depuis SQL en utilisant la fonction SQL ai_query. Voir Exemple : Query un modèle de fondation.

Interface utilisateur de service

Sélectionnez Endpoint de query dans la page Endpoint de service . Insérez les données d'entrée du modèle au format JSON et cliquez sur Envoyer la demande . Si le modèle a un exemple d'entrée journalisé, utilisez Afficher l'exemple pour le charger.

API REST

Appelez et interrogez le modèle à l'aide de l'API REST. Voir POST /serving-endpoints/{name}/invocations pour plus de détails. Pour les requêtes de scoring vers des endpoints diffusant plusieurs modèles, voir Interroger des modèles individuels derrière un endpoint.

SDK de déploiements MLflow

Utilisez la fonction predict() du SDK de déploiement MLflow pour interroger le modèle.

Databricks Python SDK

Le SDK Python de Databricks est une couche au-dessus de l'API REST. Il gère les détails de bas niveau, tels que l'authentification, ce qui facilite l'interaction avec les modèles.

Exigences

important

En tant que bonne pratique de sécurité pour les scénarios de production, Databricks vous recommande d'utiliser des jetons OAuth machine à machine pour l'authentification pendant la production.

Pour les tests et le développement, Databricks recommande d'utiliser un jeton d'accès personnel appartenant aux Service Principals au lieu des utilisateurs de Workspace. Pour créer des jetons pour les Service Principals, consultez Gérer les jetons pour un Service Principal.

Installer les packages

Après avoir sélectionné une méthode de query, vous devez d'abord installer le package approprié sur votre cluster.

Pour utiliser le client OpenAI, le package databricks-openai doit être installé sur votre cluster. Ce package fournit un client OpenAI avec une autorisation configurée automatiquement pour query les modèles d'IA générative. Exécutez l'élément suivant dans votre notebook ou votre terminal local :

pip install -U databricks-openai

Ceci n'est requis que lors de l'installation du package sur un Notebook Databricks.

Python
dbutils.library.restartPython()

Types de modèles de fondation

Le tableau suivant résume les modèles de fondation pris en charge en fonction du type de tâche.

important

Meta-Llama-3.1-405B-Instruct sera retiré,

  • À partir du 15 février 2026 pour les charges de travail avec paiement par jeton.
  • À partir du 15 mai 2026 pour les charges de travail à throughput provisionné.

Consultez les modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et les instructions de migration pendant la dépréciation.

Type de tâche

Description

Modèles pris en charge

Quand l'utiliser ? Cas d'utilisation recommandés

Usage général

Modèles conçus pour comprendre et participer à des conversations naturelles à plusieurs tours. Ils sont affinés sur de grands datasets de dialogue humain, ce qui leur permet de générer des réponses contextuellement pertinentes, de suivre l'historique des conversations et de fournir des interactions cohérentes, semblables à celles des humains, sur divers sujets.

Voici les modèles de fondation pris en charge hébergés par Databricks :

Les modèles externes pris en charge sont :

  • Modèles OpenAI GPT et série o
  • Modèles Anthropic Claude
  • Modèles Google Gemini

Recommandé pour les scénarios où un dialogue naturel à plusieurs tours et une compréhension contextuelle sont nécessaires :

  • Assistants virtuels
  • Bots d'assistance client
  • Systèmes de tutorat interactifs.

Intégrations

Les modèles d'intégration sont des systèmes de Machine Learning qui transforment des données complexes — telles que du texte, des images ou de l'audio — en vecteurs numériques compacts appelés intégrations. Ces vecteurs saisissent les caractéristiques essentielles et les relations au sein des données, permettant une comparaison, un clustering et une recherche sémantique efficaces.

Voici les modèles de fondation hébergés par Databricks pris en charge :

Les modèles externes pris en charge sont :

  • Modèles d'intégration de texte OpenAI
  • Modèles d'intégration de texte Cohere
  • Modèles d’intégration de texte Google

Recommandé pour les applications où la compréhension sémantique, la comparaison de similarité et la récupération ou le clustering efficace de données complexes sont essentiels :

  • Recherche sémantique
  • Génération augmentée de récupération (RAG)
  • Clustering de sujets
  • Analyse du sentiment et analytique de texte

Vision

Modèles conçus pour traiter, interpréter et analyser les données visuelles — comme les images et les vidéos, afin que les machines puissent « voir » et comprendre le monde visuel.

Voici les modèles de fondation pris en charge hébergés par Databricks :

Les modèles externes pris en charge sont :

  • Les modèles OpenAI GPT et de la série O avec des capacités de vision
  • Modèles Anthropic Claude avec capacités de vision
  • Modèles Google Gemini avec des capacités de vision
  • D'autres modèles de fondation externes avec des capacités de vision compatibles avec l'API OpenAI sont également pris en charge.

Recommandé partout où une analyse automatisée, précise et évolutive des informations visuelles est nécessaire :

  • Détection et reconnaissance d'objets
  • CLASSIFICATION D'IMAGES
  • Segmentation d'image
  • Compréhension des documents

Raisonnement

Systèmes d'IA avancés conçus pour simuler une pensée logique de type humain. Les modèles de raisonnement intègrent des techniques telles que la logique symbolique, le raisonnement probabiliste et les réseaux de neurones pour analyser le contexte, décomposer les tâches et expliquer leur prise de décision.

Voici les modèles de fondation hébergés par Databricks pris en charge :

Les modèles externes pris en charge sont :

  • Modèles OpenAI avec capacités de raisonnement
  • Modèles Anthropic Claude dotés de capacités de raisonnement
  • Modèles Google Gemini avec des capacités de raisonnement

Recommandé partout où une analyse automatisée, précise et évolutive des informations visuelles est nécessaire :

  • Génération de code
  • Création et synthèse de contenu
  • Orchestration des agents

Type de tâche

Description

Modèles pris en charge

Quand l'utiliser ? Cas d'utilisation recommandés

Usage général

Modèles conçus pour comprendre et participer à des conversations naturelles à plusieurs tours. Ils sont affinés sur de grands datasets de dialogue humain, ce qui leur permet de générer des réponses contextuellement pertinentes, de suivre l'historique des conversations et de fournir des interactions cohérentes, semblables à celles des humains, sur divers sujets.

Voici les modèles de fondation pris en charge hébergés par Databricks :

Les modèles externes pris en charge sont :

  • Modèles OpenAI GPT et série o
  • Modèles Anthropic Claude
  • Modèles Google Gemini

Recommandé pour les scénarios où un dialogue naturel à plusieurs tours et une compréhension contextuelle sont nécessaires :

  • Assistants virtuels
  • Bots d'assistance client
  • Systèmes de tutorat interactifs.

Intégrations

Les modèles d'intégration sont des systèmes de Machine Learning qui transforment des données complexes — telles que du texte, des images ou de l'audio — en vecteurs numériques compacts appelés intégrations. Ces vecteurs saisissent les caractéristiques essentielles et les relations au sein des données, permettant une comparaison, un clustering et une recherche sémantique efficaces.

Voici les modèles de fondation hébergés par Databricks pris en charge :

Les modèles externes pris en charge sont :

  • Modèles d'intégration de texte OpenAI
  • Modèles d'intégration de texte Cohere
  • Modèles d’intégration de texte Google

Recommandé pour les applications où la compréhension sémantique, la comparaison de similarité et la récupération ou le clustering efficace de données complexes sont essentiels :

  • Recherche sémantique
  • Génération augmentée de récupération (RAG)
  • Clustering de sujets
  • Analyse du sentiment et analytique de texte

Vision

Modèles conçus pour traiter, interpréter et analyser les données visuelles — comme les images et les vidéos, afin que les machines puissent « voir » et comprendre le monde visuel.

Voici les modèles de fondation pris en charge hébergés par Databricks :

Les modèles externes pris en charge sont :

  • Les modèles OpenAI GPT et de la série O avec des capacités de vision
  • Modèles Anthropic Claude avec capacités de vision
  • Modèles Google Gemini avec des capacités de vision
  • D'autres modèles de fondation externes avec des capacités de vision compatibles avec l'API OpenAI sont également pris en charge.

Recommandé partout où une analyse automatisée, précise et évolutive des informations visuelles est nécessaire :

  • Détection et reconnaissance d'objets
  • CLASSIFICATION D'IMAGES
  • Segmentation d'image
  • Compréhension des documents

Raisonnement

Systèmes d'IA avancés conçus pour simuler une pensée logique de type humain. Les modèles de raisonnement intègrent des techniques telles que la logique symbolique, le raisonnement probabiliste et les réseaux de neurones pour analyser le contexte, décomposer les tâches et expliquer leur prise de décision.

Voici les modèles de fondation hébergés par Databricks pris en charge :

Les modèles externes pris en charge sont :

  • Modèles OpenAI avec capacités de raisonnement
  • Modèles Anthropic Claude dotés de capacités de raisonnement
  • Modèles Google Gemini avec des capacités de raisonnement

Recommandé partout où une analyse automatisée, précise et évolutive des informations visuelles est nécessaire :

  • Génération de code
  • Création et synthèse de contenu
  • Orchestration des agents

Appel de fonction

Databricks Function Calling est compatible OpenAI et est uniquement disponible pendant le déploiement de modèles dans le cadre des API de modèle de fondation et des endpoints de déploiement qui servent des modèles externes. Pour en savoir plus, consultez l’appel de fonction sur Databricks.

Sorties structurées

Les sorties structurées sont compatibles avec OpenAI et sont uniquement disponibles lors du service de modèle dans le cadre des APIs de modèle de fondation. Pour plus de détails, consultez les sorties structurées sur Databricks.

Mise en cache des prompts

La mise en cache des invites est prise en charge pour les modèles Claude hébergés par Databricks dans le cadre des APIs de modèle de fondation.

Vous pouvez spécifier le cache_control parameter dans vos query requests pour mettre en cache ce qui suit :

  • Messages de contenu textuel dans le tableau messages.content.
  • Contenu des messages dans le tableau messages.content.
  • Blocs de contenu d'images dans le tableau messages.content.
  • Utilisation des outils, résultats et définitions dans le tableau tools.

Consultez la référence de l'API REST des modèles de fondation.

JSON
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What's the date today?",
"cache_control": { "type": "ephemeral" }
}
]
}
]
}
remarque

L'API REST de Databricks est compatible avec OpenAI et diffère de l'API Anthropic. Ces différences ont également un impact sur les objets de réponse comme les suivants :

  • La sortie est renvoyée dans le champ choices.
  • Format de segment streaming. Tous les segments adhèrent au même format où choices contient la réponse delta et l'utilisation est renvoyée dans chaque segment.
  • Le motif de l'arrêt est renvoyé dans le champ finish_reason.
    • Anthropic utilise : end_turn, stop_sequence, max_tokens, et tool_use
    • Respectivement, Databricks utilise : stop, stop, length et tool_calls

Discutez avec des LLM pris en charge à l'aide d'AI Playground.

Vous pouvez interagir avec des grands modèles linguistiques pris en charge en utilisant l'AI Playground. L'AI Playground est un environnement de chat où vous pouvez tester, créer des prompts et comparer des LLM depuis votre Workspace Databricks.

Espace d'expérimentation IA

Ressources supplémentaires