Référence de l'API REST Foundation Model
Cet article fournit des informations générales sur l'API pour les APIs de modèle de fondation Databricks et les modèles qu'elles prennent en charge. Les APIs Foundation Model sont conçues pour être similaires à l'API REST d'OpenAI afin de faciliter la migration des projets existants. Les Endpoint de throughput provisionné et de paiement au jeton acceptent tous deux le même format de requête d'API REST.
Endpoint
Les APIs de modèle de fondation prennent en charge les endpoints de paiement au jeton et les endpoints de throughput provisionné.
Un Endpoint préconfiguré est disponible dans votre Workspace pour chaque modèle pris en charge avec paiement par jeton, et les utilisateurs peuvent interagir avec ces Endpoints à l'aide de requêtes HTTP POST. Pour les modèles pris en charge, consultez la page Modèles de fondation pris en charge sur Model Serving.
Les endpoints de débit throughput peuvent être créés à l'aide de l'API ou de l'interface utilisateur de Serving. Ces Endpoint prennent en charge plusieurs modèles par Endpoint pour les tests A/B, tant que les deux modèles déployés exposent le même format d'API. Par exemple, les deux modèles sont des modèles de chat. Voir POST /api/2.0/serving-endpoints pour les paramètres de configuration de l'endpoint.
Les requêtes et les réponses utilisent JSON, la structure JSON exacte dépend du type de tâche d'un endpoint. Les endpoints de chat et de complétion prennent en charge les réponses en streaming.
Utilisation
Les réponses incluent un sous-message usage qui indique le nombre de jetons dans la requête et la réponse. Le format de ce sous-message est le même pour tous les types de tâches.
Champ | Type | Description |
|---|---|---|
| Entier | Nombre de jetons générés. Non inclus dans les réponses d'intégration. |
| Entier | Nombre de jetons des invites d'entrée. |
| Entier | Nombre total de jetons. |
| Entier | Nombre de jetons de réflexion. Ceci n'est applicable qu'aux modèles de raisonnement. |
Pour les modèles comme databricks-meta-llama-3-3-70b-instruct, une requête utilisateur est transformée à l’aide d’un template de prompt avant d’être transmise au modèle. Pour les Endpoint au paiement par jeton, une invite système peut également être ajoutée. prompt_tokens comprend tout le texte ajouté par notre serveur.
API Responses
Cette référence de l'API de réponses s'applique aux modèles OpenAI. Pour utiliser le format de requête de réponses avec Anthropic Claude, Google Gemini ou des modèles ouverts hébergés par Databricks, consultez Query un modèle avec l'API Open Responses.
L'API Réponses permet des conversations multi-tours avec un modèle. Contrairement aux Complétions de chat, l'API Réponses utilise input au lieu de messages.
Requêtes API
Champ | Par défaut | Type | Description |
|---|---|---|---|
| Chaîne | Obligatoire . ID du modèle utilisé pour générer la réponse. | |
| Chaîne ou List[ResponsesInput] | Obligatoire . Entrées de texte, d'image ou de fichier pour le modèle, utilisées pour générer une réponse. Contrairement à | |
|
| Chaîne | Un message système (ou de développeur) inséré dans le contexte du modèle. |
|
|
| Une limite supérieure pour le nombre de jetons pouvant être générés pour une réponse, incluant les jetons de sortie visibles et les jetons de raisonnement. |
|
| Présentation libre dans [0,2] | La température d'échantillonnage. 0 est déterministe et des valeurs plus élevées introduisent plus de caractère aléatoire. |
|
| Valeur flottante dans (0,1] | Le threshold de probabilité utilisé pour l'échantillonnage de noyau. |
|
| Booléen | Si la valeur est true, les données de réponse du modèle seront Stream au client au fur et à mesure de leur génération à l’aide d’événements envoyés par le serveur. |
|
| Options pour les réponses en streaming. Ne le définissez que lorsque vous définissez | |
|
| Options de configuration pour une réponse textuelle du modèle. Peut être du texte brut ou des données JSON structurées. | |
|
| Configuration du raisonnement pour les modèles gpt-5 et o-series. | |
|
| Chaîne ou ToolChoiceObject | Comment le modèle doit sélectionner l'outil (ou les outils) à utiliser lors de la génération d'une réponse. Consultez le paramètre |
|
| Liste[ToolObject] | Un ensemble d'outils que le modèle peut appeler lors de la génération d'une réponse. Note : L'interpréteur de code et les outils de recherche web ne sont pas pris en charge par Databricks. |
|
| Booléen | S’il faut autoriser le modèle à exécuter des appels d'outil en parallèle. |
|
| Entier supérieur à zéro | Le nombre maximal d'appels totaux aux outils intégrés pouvant être traités dans une réponse. |
|
| Objet | Ensemble de 16 paires clé-valeur pouvant être associées à un objet. |
|
| Chaîne | Utilisé pour mettre en cache les réponses pour des requêtes similaires afin d'optimiser les taux de réussite du cache. Remplace le champ |
|
| Chaîne | La politique de rétention pour le cache de requêtes. Définissez sur |
|
| Chaîne | Un identifiant stable utilisé pour aider à détecter les utilisateurs de votre application qui pourraient violer les politiques d'utilisation. |
|
| Chaîne | Obsolète . Utilisez |
|
| Chaîne | La stratégie de troncation à utiliser pour la réponse du modèle. |
|
| Entier | Un entier entre 0 et 20 spécifiant le nombre de jetons les plus probables à retourner à chaque position de jeton, chacun avec une probabilité logarithmique associée. |
|
| Liste[Chaîne] | Spécifiez des données de sortie supplémentaires à inclure dans la réponse du modèle. |
|
| Objet | Référence à un Template de prompt et à ses variables. |
Paramètres non pris en charge : Les paramètres suivants ne sont pas pris en charge par Databricks et renverront une erreur 400 s'ils sont spécifiés.
background- Le traitement en arrière-plan n'est pas pris en chargestore- Les réponses stockées ne sont pas prises en chargeconversation- L'API de conversation n'est pas prise en chargeservice_tier- La sélection du niveau de service est gérée par Databricks
ResponsesInput
Le champ input accepte soit une chaîne de caractères, soit une liste d'objets de message d'entrée avec rôle et contenu.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le rôle de l'auteur du message. Peut être |
| Chaîne ou Liste[ResponsesContentBlock] | Obligatoire . Le contenu du message, soit sous forme de chaîne de caractères, soit sous forme de tableau de blocs de contenu. |
ResponsesContentBlock
Les blocs de contenu définissent le type de contenu dans les messages d'entrée et de sortie. Le type de bloc de contenu est déterminé par le champ type.
InputText
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . Le contenu textuel. |
OutputText
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . Le contenu textuel. |
| List[Objet] | Annotations facultatives pour le contenu textuel. |
InputImage
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . URL ou URI de données encodées en base64 de l'image. |
InputFile
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Identifiant du fichier si vous utilisez des fichiers upload. |
| Chaîne | Le nom du fichier. |
| Chaîne | URI de données encodée en Base64 avec préfixe de format. Par exemple, les fichiers PDF utilisent le format |
FunctionCall
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . Identifiant unique pour l'appel de fonction. |
| Chaîne | Obligatoire . L'identifiant d'appel. |
| Chaîne | Obligatoire . Le nom de la fonction appelée. |
| Objet/Chaîne | Obligatoire . Les arguments de fonction en tant qu'objet JSON ou chaîne. |
FunctionCallOutput
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . L'identifiant d'appel auquel correspond cette sortie. |
| Chaîne/Objet | Obligatoire . La sortie de la fonction sous forme de chaîne ou d'objet JSON. |
CustomToolCall
Renvoie dans le tableau output de la réponse lorsqu'un outil personnalisé est appelé. Contrairement aux appels de fonction, les appels d'outils personnalisés renvoient du texte brut input au lieu de JSON arguments.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . Identifiant unique pour cet appel d'outil personnalisé. |
| Chaîne | Obligatoire . L'identifiant d'appel. |
| Chaîne | Obligatoire . Le nom de l'outil personnalisé appelé. |
| Chaîne | Obligatoire . L’entrée de l’outil en texte brut (pas en JSON). |
| Chaîne | L'état de l'appel de l'outil. L’un des éléments suivants : |
CustomToolCallOutput
Utilisez ce type d'entrée pour fournir le résultat d'un appel d'outil personnalisé au modèle dans une conversation à plusieurs tours.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Obligatoire . L'identifiant d'appel auquel correspond cette sortie. |
| Chaîne | Obligatoire . La sortie de l'outil personnalisé sous forme de chaîne. |
StreamOptions
Configuration pour les réponses en streaming. Utilisé uniquement lorsque stream: true.
Champ | Type | Description |
|---|---|---|
| Booléen | Si vrai, incluez les informations d'utilisation des jetons dans le Stream. default est |
TextConfig
Configuration de la sortie de texte, y compris les sorties structurées.
Champ | Type | Description |
|---|---|---|
| La spécification de format pour la sortie de texte. |
ResponsesFormatObject
Spécifie le format de sortie pour les réponses textuelles.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le type de format : |
| Objet | **Obligatoire** |
L'objet json_schema a la même structure que JsonSchemaObject documenté dans l'API Chat Completions.
ReasoningConfig
Configuration du comportement de raisonnement dans les modèles de raisonnement (modèles de la série O et gpt-5).
Champ | Type | Description |
|---|---|---|
| Chaîne | Le niveau d'effort de raisonnement : |
| Chaîne | Contenu de raisonnement chiffré pour le mode sans état. Fourni par le modèle dans les réponses précédentes. |
ToolObject
Consultez Appel de fonction sur Databricks.
L'API de réponses prend en charge les types d'outils suivants : function, custom, mcp, image_generation, shell. Les outils personnalisés et les formats de sortie basés sur la grammaire ne sont disponibles qu'avec les modèles de la série GPT-5 (gpt-5, gpt-5.1, gpt-5.2).
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le type de l'outil. Voir la note ci-dessus pour les valeurs prises en charge. |
| Requis lorsque | |
| Chaîne | Requis lorsque |
| Chaîne | Requis lorsque |
| Facultatif. Lorsque |
CustomToolObject
Les outils personnalisés permettent au modèle de renvoyer une sortie de chaîne arbitraire au lieu d'arguments de fonction formatés en JSON. Ceci est utile pour la génération de code, l'application de correctifs ou d'autres cas d'utilisation où le JSON structuré n'est pas requis.
Les outils personnalisés ne sont pris en charge qu'avec les modèles de la série GPT-5 (gpt-5, gpt-5.1, gpt-5.2) via l'API Responses.
Exemple d'outil personnalisé :
{
"type": "custom",
"name": "code_exec",
"description": "Executes arbitrary Python code. Return only valid Python code."
}
Exemple d’outil personnalisé avec grammaire :
{
"type": "custom",
"name": "apply_patch",
"description": "Apply a patch to create or modify files.",
"format": {
"type": "grammar",
"definition": "start: begin_patch hunk end_patch\nbegin_patch: \"*** Begin Patch\" LF\n...",
"syntax": "lark"
}
}
Lorsqu'un outil personnalisé est appelé, la réponse contient un élément de sortie custom_tool_call avec du texte brut input au lieu de JSON arguments.
CustomFormat
Les formats de sortie basés sur la grammaire ne sont pris en charge qu’avec les modèles de la série GPT-5.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Soit |
| Chaîne | Requis lorsque |
| Chaîne | Requis lorsque |
FunctionObject
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le nom de la fonction à appeler. |
| Objet | Obligatoire . La description détaillée de la fonction. Le modèle utilise cette description pour comprendre la pertinence de la fonction par rapport à l'invite et générer les appels d'outils avec une plus grande précision. |
| Objet | Les paramètres que la fonction accepte, décrits comme un objet de schéma JSON valide. Si l'outil est appelé, l'appel de l'outil est conforme au schéma JSON fourni. L'omission de paramètres définit une fonction sans aucun paramètre. Le nombre de |
| Booléen | Faut-il activer l'adhérence stricte au schéma lors de la génération de l'appel de fonction. Si défini sur |
ToolChoiceObject
Consultez Appel de fonction sur Databricks.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le type de l'outil à forcer. Les valeurs prises en charge correspondent aux types d'outils dans ToolObject: |
| Objet | Requis lorsque |
| Chaîne | Requis lorsque |
Réponse de l'API de réponses
Pour les requêtes non-streaming, la réponse est un objet de réponse unique. Pour les requêtes de streaming, la réponse est un text/event-stream où chaque événement est un segment de réponse.
Champ | Type | Description |
|---|---|---|
| Chaîne | Identifiant unique pour la réponse. Note : Databricks chiffre cet ID pour des raisons de sécurité. |
| Chaîne | Le type d'objet. Égal à |
| Entier | L'Unix Timestamp (en secondes) lorsque la réponse a été créée. |
| Chaîne | Le statut de la réponse. Un de : |
| Chaîne | La version du modèle utilisée pour générer la réponse. |
| Liste[ResponsesMessage] | La sortie générée par le modèle, contenant généralement des objets de message. |
| Métadonnées d'utilisation des jetons. | |
| informations d'erreur si la réponse a échoué. | |
| Détails expliquant pourquoi la réponse est incomplète, le cas échéant. | |
| Chaîne | Les instructions fournies dans la requête. |
| Entier | Le nombre maximal de jetons de sortie spécifié dans la requête. |
| Présentation libre | La température utilisée pour la génération. |
| Présentation libre | La valeur top_p utilisée pour la génération. |
| Liste[ToolObject] | Les outils spécifiés dans la requête. |
| Chaîne ou ToolChoiceObject | Le paramètre tool_choice de la requête. |
| Booléen | Si les appels d'outils parallèles ont été activés. |
| Booléen | Si la réponse a été stockée. |
| Objet | Les métadonnées attachées à la réponse. |
ResponsesMessage
Objets de message dans le champ output contenant le contenu de la réponse du modèle.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Identifiant unique pour le message. |
| Chaîne | Obligatoire . Le rôle du message. Soit |
| Liste[ResponsesContentBlock] | Obligatoire . Les blocs de contenu dans le message. |
| Chaîne | Le statut du traitement des messages. |
| Chaîne | Obligatoire . Le type d’objet. Égal à |
Error
Informations d'erreur lorsqu'une réponse échoue.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le code d'erreur. |
| Chaîne | Obligatoire . Un message d'erreur lisible par l'homme. |
| Chaîne | Le parameter qui a causé l’erreur, le cas échéant. |
| Chaîne | Obligatoire . Le type d'erreur. |
IncompleteDetails
Détails expliquant pourquoi une réponse est incomplète.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . La raison pour laquelle la réponse est incomplète. |
API Chat Completions
L'API Chat Completions permet des conversations multi-tours avec un modèle. La réponse du modèle fournit le assistant message suivant dans la conversation. Voir POST /serving-endpoints/{name}/invocations pour interroger les parameters d'endpoint.
Demande de chat
Champ | Par défaut | Type | Description |
|---|---|---|---|
| Liste ChatMessage | Obligatoire . Une liste de messages représentant la conversation actuelle. | |
|
|
| Le nombre maximum de jetons à générer. |
|
| Booléen | Stream responses back to a client in order to allow partial results for requests. Si ce parameter est inclus dans la requête, les réponses sont envoyées à l'aide de la norme des événements envoyés par le serveur. |
|
| Présentation libre dans [0,2] | La température d'échantillonnage. 0 est déterministe et des valeurs plus élevées introduisent plus de caractère aléatoire. |
|
| Valeur flottante dans (0,1] | Le threshold de probabilité utilisé pour l'échantillonnage de noyau. |
|
|
| Définit le nombre de k jetons les plus probables à utiliser pour le filtrage top-k. Définissez cette valeur sur 1 pour rendre les sorties déterministes. |
| [] | Chaîne ou Liste[Chaîne] | Le modèle arrête de générer des jetons supplémentaires lorsque l'une des séquences de |
| 1 | Entier supérieur à zéro | L'API renvoie |
|
| Chaîne ou ToolChoiceObject | Utilisé uniquement en conjonction avec le champ |
|
| Une liste de | |
|
| Un objet spécifiant le format que le modèle doit générer en sortie. Les types acceptés sont | |
|
| Booléen | Ce paramètre indique s'il faut fournir la probabilité logarithmique d'échantillonnage d'un jeton. |
|
| Entier | Ce parameter contrôle le nombre de candidats de jetons les plus probables pour lesquels retourner les probabilités logarithmiques à chaque étape d'échantillonnage. Peut être de 0 à 20. |
|
| Chaîne | Contrôle le niveau d'effort de raisonnement que le modèle doit appliquer lors de la génération des réponses. Les valeurs acceptées sont |
ChatMessage
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le rôle de l'auteur du message. Peut être |
| Chaîne ou Liste[ContentItem] | Obligatoire pour les tâches de chat qui n'impliquent pas d'appels d'outils. Le contenu peut être une chaîne de caractères ou un tableau qui contient une série d'éléments multimodaux dans une seule interaction de chat. Ces éléments suivent la séquence dans laquelle ils sont traités comme entrées ou sorties par les modèles. Cette entrée de tableau est spécifiquement conçue pour une utilisation avec des modèles propriétaires accessibles uniquement par l'intermédiaire de fournisseurs de modèles externes. Actuellement, seuls les modèles Claude sont pris en charge. Utilisez du contenu de type chaîne de caractères pour d'autres fournisseurs de modèles externes, des modèles open source (Llama) ou des modèles hébergés par des clients sur Databricks. |
| ToolCall liste | La liste de |
| Chaîne | Lorsque |
Le rôle system ne peut être utilisé qu’une seule fois, comme premier message dans une conversation. Il ignore l'invite système par default du modèle.
ContentItem
ContentItem est l'un des types de contenu suivants : TextContent, ReasoningContent, DocumentContent ou ImageContent
TextContent
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être un texte. |
| Chaîne | Contenu textuel requis. |
| Liste[Citation] | Informations de citation facultatives. Consultez le tableau ci-dessous. |
| Chaîne | Active la mise en cache de votre requête. Ce parameter n'est accepté que par les modèles Claude hébergés par Databricks. Pour un exemple, consultez Mise en cache des prompts. |
Les champs de citations sont les suivants :
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Le texte extrait du document. |
| Entier | L'index du document cité. |
| Chaîne | Le titre du document cité. |
| Entier | L'index de début du texte cité dans le document. |
| Entier | L'index de fin du texte cité dans le document. |
ImageContent
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être un(e) |
| ImageURL | Équivalent à l'objet image_url d'OpenAI. |
| Chaîne | Active la mise en cache de votre requête. Ce paramètre est accepté uniquement par le modèle Claude hébergé par Databricks. Le contenu du message d'image doit utiliser les données encodées comme source. Les URL ne sont actuellement pas prises en charge. Voir Mise en cache des prompts pour un exemple. |
Les champs ImageURL sont ci-dessous :
Champ | Type | Description |
|---|---|---|
| Chaîne | Données d'image encodées en Base64. Doit être une chaîne base64 valide générée à partir d'un format de fichier image pris en charge (JPEG, PNG, GIF, WebP, etc.). |
| Chaîne | Spécifie le niveau de détail de l'image. |
ReasoningContent
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être un(e) |
| List[Résumé] | Contenus textuels de raisonnement. Le résumé peut être |
| Chaîne | Active la mise en cache de votre requête. Ce parameter est uniquement accepté par les modèles Claude hébergés par Databricks. Pour un exemple, consultez Mise en cache des prompts. |
TextSummary
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être un(e) |
| Chaîne | Un bref résumé du raisonnement utilisé par le modèle lors de la génération de la réponse. |
| Chaîne | Jetons cryptographiques facultatifs pour vérifier l'authenticité des données. |
EncryptedTextSummary
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être un |
| Chaîne | Contenu texte chiffré qui n'est pas lisible par l'homme pour des raisons de sécurité. |
DocumentContent
DocumentContent est uniquement destiné aux requêtes.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être |
| Chaîne | Titre du document. |
| Chaîne | Description du document. |
| Source | Obligatoire . Fournit plus d’informations sur le document, y compris son format et son contenu. |
| Map[string, bool] | Mappage avec un champ unique « enabled » qui correspond à un booléen indiquant s'il faut activer les citations pour le document. |
Source
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être l’un des suivants : |
| Chaîne | Requis pour le type PDF et texte. - Doit être |
| Chaîne | Obligatoire pour les PDF et le texte. Les données contenant la source du document. |
| Chaîne ou Liste[Contenu textuel] ou Liste[Contenu d'image] | Obligatoire pour le type |
| Chaîne | Obligatoire pour le type URLPDFSource. L'URL du document PDF. |
FileContent
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Doit être un fichier. |
| Fichier | Obligatoire Contenu du fichier. |
Les champs du fichier sont ci-dessous :
Champ | Type | Description |
|---|---|---|
| Chaîne | Le nom du fichier. |
| Chaîne | Obligatoire . Données de fichier encodées en base64 compatibles avec OpenAI. Cela commence par le format de fichier suivi des données encodées en base64. Par exemple, un fichier PDF a un format en |
| Chaîne | L'URL du fichier accessible publiquement. Pris en charge uniquement pour les modèles Gemini. |
ToolCall
Une suggestion d'action d'appel d'outil par le modèle. Voir l'appel de fonction sur Databricks.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Un identifiant unique pour cette suggestion d'appel d'outil. |
| Chaîne | Obligatoire . Seul |
| Obligatoire . Un appel de fonction suggéré par le modèle. | |
| Chaîne | Active la mise en cache de votre requête. Ce parameter n'est accepté que par les modèles Claude hébergés par Databricks. Pour un exemple, consultez Mise en cache des prompts. |
FunctionCallCompletion
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire. Le nom de la fonction recommandée par le modèle. |
| Objet | Obligatoire. Arguments de la fonction sous forme de dictionnaire JSON sérialisé. |
**Remarque**ToolChoiceObject ToolObject:, et FunctionObject sont définis dans la section APIs Réponses et sont partagés entre les deux API.
ResponseFormatObject
Consultez les sorties structurées sur Databricks.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le type de format de réponse en cours de définition. Soit |
| Obligatoire . Le schéma JSON à respecter si |
JsonSchemaObject
Consultez les sorties structurées sur Databricks.
Champ | Type | Description |
|---|---|---|
| Chaîne | Obligatoire . Le nom du format de réponse. |
| Chaîne | Une description de l'objectif du format de réponse, utilisée par le modèle pour déterminer comment répondre dans ce format. |
| Objet | Obligatoire . Le schéma du format de réponse, décrit comme un objet de schéma JSON. |
| Booléen | S'il faut activer une adhésion stricte au schéma lors de la génération de la sortie. Si défini sur |
Réponse du chat
Pour les requêtes non-streaming, la réponse est un seul objet d'achèvement du chat. Pour les requêtes de streaming, la réponse est un text/event-stream où chaque événement est un objet de bloc de complétion. La structure de niveau supérieur des objets de complétion et de segment est presque identique : seul choices a un type différent.
Champ | Type | Description |
|---|---|---|
| Chaîne | Identifiant unique pour l'achèvement du chat. |
| List[ChatCompletionChoice] ou List[ChatCompletionChunk] (streaming) | Liste des textes d'achèvement de chat. |
| Chaîne | Le type d'objet. Égal à |
| Entier | L'heure à laquelle l'achèvement du chat a été généré en secondes. |
| Chaîne | La version du modèle utilisée pour générer la réponse. |
| Métadonnées d'utilisation des jetons. Peut ne pas être présent sur les réponses de streaming. |
ChatCompletionChoice
Champ | Type | Description |
|---|---|---|
| Entier | L'index du choix dans la liste des choix générés. |
| Un message de complétion de chat renvoyé par le modèle. Le rôle sera | |
| Chaîne | La raison pour laquelle le modèle a cessé de générer des jetons. |
| Chaîne | Lors de l'utilisation de modèles propriétaires provenant de fournisseurs de modèles externes, les APIs du fournisseur peuvent inclure des métadonnées supplémentaires dans les réponses. Databricks filtre ces réponses et ne renvoie qu'un sous-ensemble des champs d'origine du fournisseur. Le |
ChatCompletionChunk
Champ | Type | Description |
|---|---|---|
| Entier | L'index du choix dans la liste des choix générés. |
| Une partie du message de complétion de chat des réponses générées en Stream par le modèle. Seul le premier segment est garanti d'avoir | |
| Chaîne | La raison pour laquelle le modèle a cessé de générer des jetons. Seul le dernier segment sera renseigné. |
API Embeddings
Les tâches d'intégration mappent les chaînes d'entrée en vecteurs d'intégration. De nombreuses entrées peuvent être regroupées par batch dans chaque requête. Voir POST /serving-endpoints/{name}/invocations pour interroger les paramètres d'endpoint.
Demande d'intégration
Champ | Type | Description |
|---|---|---|
| Chaîne ou Liste[Chaîne] | Obligatoire . Le texte d'entrée à intégrer. Peut être une chaîne ou une liste de chaînes. |
| Chaîne | Une instruction facultative à transmettre au modèle d'intégration. |
| Entier | Facultatif. Le nombre de dimensions que les intégrations de sortie résultantes devraient avoir. Doit être une puissance de 2 allant de 32 à 1024. Pris en charge uniquement pour |
Les instructions sont facultatives et très spécifiques au modèle. Par exemple, les auteurs BGE recommandent de n'utiliser aucune instruction lors de l'indexation de fragments et recommandent d'utiliser l'instruction "Represent this sentence for searching relevant passages:" pour les queries de récupération. Les auteurs de Qwen3-Embedding recommandent une instruction spécifique à la tâche telle que "Given a web search query, retrieve relevant passages that answer the query" pour les queries de récupération, et aucune instruction lors de l'intégration de documents de récupération. D'autres modèles, comme Instructor-XL, prennent en charge un large éventail de chaînes d'instructions.
Réponse des intégrations
Champ | Type | Description |
|---|---|---|
| Chaîne | Identifiant unique pour l'intégration. |
| Chaîne | Le type d'objet. Égal à |
| Chaîne | Le nom du modèle d'intégration utilisé pour créer l'intégration. |
| L'objet d'intégration. | |
| Métadonnées d'utilisation des jetons. |
EmbeddingObject
Champ | Type | Description |
|---|---|---|
| Chaîne | Le type d'objet. Égal à |
| Entier | L'index de l'embedding dans la liste des embeddings générés par le modèle. |
| Liste[Flottant] | Le vecteur d'intégration. Chaque modèle renverra un vecteur de taille fixe (1024 pour BGE-Large). |
API de complétions
Les tâches d'achèvement de texte servent à générer des réponses à une seule invite. Contrairement au Chat, cette tâche prend en charge les entrées groupées : plusieurs invites indépendantes peuvent être envoyées en une seule requête. Voir POST /serving-endpoints/{name}/invocations pour interroger les paramètres d'endpoint.
Demande de complétion
Champ | Par défaut | Type | Description |
|---|---|---|---|
| Chaîne ou Liste[Chaîne] | Obligatoire . Les prompts pour le modèle. | |
|
|
| Le nombre maximum de jetons à générer. |
|
| Booléen | Stream responses back to a client in order to allow partial results for requests. Si ce parameter est inclus dans la requête, les réponses sont envoyées à l'aide de la norme des événements envoyés par le serveur. |
|
| Présentation libre dans [0,2] | La température d'échantillonnage. 0 est déterministe et des valeurs plus élevées introduisent plus de caractère aléatoire. |
|
| Valeur flottante dans (0,1] | Le threshold de probabilité utilisé pour l'échantillonnage de noyau. |
|
|
| Définit le nombre de k jetons les plus probables à utiliser pour le filtrage top-k. Définissez cette valeur sur 1 pour rendre les sorties déterministes. |
|
|
| Pour les erreurs de délai d'attente et de dépassement de la longueur du contexte. L'un des éléments suivants : |
| 1 | Entier supérieur à zéro | L'API renvoie |
| [] | Chaîne ou Liste[Chaîne] | Le modèle arrête de générer des jetons supplémentaires lorsque l'une des séquences de |
|
| Chaîne | Une chaîne qui est ajoutée à la fin de chaque achèvement. |
|
| Booléen | Renvoie l'invite ainsi que la complétion. |
|
| Booléen | Si |
Réponse de complétion
Champ | Type | Description |
|---|---|---|
| Chaîne | Identifiant unique pour la complétion de texte. |
| Une liste de complétions de texte. Pour chaque invite transmise, | |
| Chaîne | Le type d'objet. égal à |
| Entier | Le temps pendant lequel la complétion a été générée en secondes. |
| Métadonnées d'utilisation des jetons. |
CompletionChoice
Champ | Type | Description |
|---|---|---|
| Entier | L’index du prompt dans la requête. |
| Chaîne | La complétion générée. |
| Chaîne | La raison pour laquelle le modèle a cessé de générer des jetons. |