Aller au contenu principal

Modèles de fondation hébergés par Databricks disponibles dans les API Foundation Model

Cet article décrit les modèles ouverts de pointe qui sont pris en charge par les API de modèles de fondation Databricks.

remarque

Consultez Modèles de fondation pris en charge sur Model Serving pour connaître la disponibilité régionale de ces modèles et les fonctionnalités prises en charge.

Vous pouvez envoyer des requêtes de query à ces modèles en utilisant les Endpoints de paiement au jeton disponibles dans votre Workspace Databricks. Consultez Utiliser les modèles de fondation et le tableau des modèles pris en charge par paiement au jeton pour connaître les noms des Endpoint de modèle à utiliser.

En plus de prendre en charge les modèles en mode paiement au jeton, les APIs de modèle de fondation offrent également un mode throughput provisionné. Databricks recommande le throughput provisionné pour les charges de travail de production. Ce mode prend en charge tous les modèles d'une famille d'architecture de modèles, y compris les modèles affinés et pré-entraînés personnalisés pris en charge en mode paiement au jeton. Voir les APIs de modèle de fondation avec throughput provisionné pour la liste des architectures prises en charge.

Vous pouvez interagir avec ces modèles pris en charge à l'aide de l'AI Playground.

OpenAI GPT-5.6 Sol

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-6-sol

Entrées prises en charge : texte, image

GPT-5.6 Sol, également appelé GPT-5.6, est le modèle phare d'OpenAI de la famille GPT-5.6, offrant des performances de pointe en matière de codage agentique, de raisonnement à long terme et d'utilisation complexe d'outils, avec une prise en charge d'un nouvel effort de raisonnement maximal. Ce modèle prend en charge les entrées multimodales et dispose d'une fenêtre de contexte de jetons totale de 1,05M avec 128K jetons de sortie maximum.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.6 Terra

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-6-terra

Entrées prises en charge : texte, image

GPT-5.6 Terra est le modèle équilibré de la famille GPT-5.6 d'OpenAI pour les charges de travail d'agent et de raisonnement quotidiennes, offrant des performances concurrentielles avec GPT-5.5 à un coût inférieur. Ce modèle prend en charge les entrées multimodales et dispose d'une fenêtre de contexte de jetons totale de 1,05M avec 128K jetons de sortie maximum.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.6 Luna

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-6-luna

Entrées prises en charge : texte, image

GPT-5.6 Luna est le modèle rapide et rentable de la famille GPT-5.6 d'OpenAI, offrant de solides capacités de raisonnement et d'agentivité au coût le plus bas de la gamme. Ce modèle prend en charge les entrées multimodales et dispose d'une fenêtre de contexte totale de 400K jetons avec 128K jetons de sortie maximum.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.5 Pro

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

GPT-5.5 Pro utilise la mise en cache étendue des prompts. Les tenseurs mis en cache sont stockés dans le stockage local au GPU pendant 24 heures seulement.

remarque

Ce modèle n'est pas pris en charge dans AI Playground. Utilisez l'API Responses pour interagir avec ce modèle.

Nom de l'Endpoint : databricks-gpt-5-5-pro

Entrées prises en charge : texte, image

GPT-5.5 Pro est une variante de GPT-5.5 à plus haute précision visant à résoudre les problèmes les plus difficiles, notamment la recherche approfondie, les mathématiques avancées et le raisonnement à enjeux élevés. Ce modèle prend en charge les entrées multimodales et dispose d'une fenêtre de contexte de jetons totale de 400 K avec un maximum de 128 K jetons de sortie.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.5

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

GPT-5.5 utilise la mise en cache étendue des prompts. Les tenseurs mis en cache sont stockés dans le stockage local au GPU pendant 24 heures seulement.

remarque

Ce modèle n'est pas pris en charge dans AI Playground. Utilisez l'API Responses pour interagir avec ce modèle.

Nom de l'Endpoint : databricks-gpt-5-5

Entrées prises en charge : texte, image

GPT-5.5 est le modèle de pointe le plus puissant d'OpenAI pour les workflows d'agents d'entreprise, le raisonnement documentaire complexe et les agents de codage à long terme. GPT-5.5 alimente également Codex, l'agent de codage d'OpenAI. Ce modèle prend en charge les entrées multimodales et dispose d'une fenêtre de contexte totale de 400K jetons avec 128K jetons de sortie maximum.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.4

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-4

Entrées prises en charge : texte, image

GPT-5.4 est un grand modèle linguistique polyvalent doté de capacités de raisonnement développé par OpenAI. Il offre des performances améliorées pour les tâches complexes avec une précision accrue et un raisonnement structuré plus délibéré. Ce modèle prend en charge les entrées multimodales et dispose d'une fenêtre de contexte totale de 400K jetons avec 128K jetons de sortie maximum.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.4 Mini

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-4-mini

Entrées prises en charge : texte, image

GPT-5.4 mini est un grand modèle de langage à usage général optimisé en termes de coûts et doté de capacités de raisonnement développé par OpenAI. Basé sur le GPT-5.4 architecture, ce modèle offre des performances améliorées sur des tâches bien définies qui nécessitent un raisonnement fiable, un langage précis et une sortie rapide. Il prend en charge les entrées multimodales et dispose d’une fenêtre de contexte totale de 400 K jetons avec un maximum de 128 K jetons de sortie.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.4 nano

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-4-nano

Entrées prises en charge : texte, image

GPT-5.4 nano est un grand modèle de langage à usage général doté de capacités de raisonnement développé par OpenAI. Basé sur le GPT-5.4 architecture, ce modèle excelle dans les tâches à haut throughput, comme le suivi d'instructions simples ou la classification pour les processus métier de routine ou les applications mobiles. Il prend en charge les entrées multimodales et dispose d’une fenêtre de contexte totale de 400 K jetons avec un maximum de 128 K jetons de sortie.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.3 Codex

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

remarque

Ce modèle n'est pas pris en charge dans AI Playground. Utilisez l'API Responses pour interagir avec ce modèle.

Nom de l'Endpoint : databricks-gpt-5-3-codex

Entrées prises en charge : texte, image

GPT-5.3 Codex est le modèle de codage agentique le plus avancé d'OpenAI, conçu pour gérer des tâches complexes et de longue durée qui impliquent de la recherche, l'utilisation d'outils et l'exécution. Il combine des performances de codage de pointe avec le raisonnement et les connaissances professionnelles de GPT-5.2, tout en fonctionnant 25 % plus rapidement. Le modèle prend en charge les entrées multimodales et dispose d'une fenêtre contextuelle totale de 400K jetons avec un maximum de 128K jetons de sortie.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.2

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-2

Entrées prises en charge : texte, image

GPT-5.2 est un grand modèle de langage à usage général doté de capacités de raisonnement développé par OpenAI. Ce modèle s'appuie directement sur GPT-5.1, offrant une précision accrue, une efficacité améliorée des jetons pour les tâches de complexité moyenne à élevée et un raisonnement échafaudé plus délibéré. Ce modèle excelle dans l'extraction structurée, les workflows en plusieurs étapes et les tâches multimodales. Il prend en charge les entrées multimodales et dispose d’une fenêtre de contexte totale de 400 K jetons avec un maximum de 128 K jetons de sortie.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5.1

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-1

Entrées prises en charge : texte, image

GPT-5.1 est un grand modèle de langage polyvalent avec des capacités de raisonnement développé par OpenAI. Ce modèle propose des modes Instantané et Réflexion pour une conversation rapide ou un raisonnement approfondi, s'adaptant automatiquement aux tâches simples ou complexes. Le modèle excelle dans la création de contenu, le tutorat, le support technique et le codage, avec moins de dépendance à une ingénierie de prompt stricte que les versions précédentes. Il prend en charge les entrées multimodales et dispose d'une fenêtre de contexte de 400K jetons au total avec 128K jetons de sortie maximum. En savoir plus sur GPT-5.1.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5

Entrées prises en charge : texte, image

GPT-5 est un grand modèle de langage et un modèle de raisonnement de pointe à usage général, conçu et entraîné par OpenAI. Il prend en charge les entrées multimodales et dispose d'une fenêtre de contexte totale de 400 000 jetons, avec un maximum de 128 000 jetons de sortie. Le modèle est conçu pour le codage, le chat, le raisonnement et les tâches axées sur les agents.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5 Mini

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-mini

Entrées prises en charge : texte, image

GPT-5 mini est un grand modèle de langage et un modèle de raisonnement de pointe, à usage général, créé et entraîné par OpenAI. Il prend en charge les entrées multimodales et dispose d'une fenêtre de contexte totale de 400 000 jetons, avec un maximum de 128 000 jetons de sortie. Le modèle est optimisé en termes de coût pour les charges de travail de raisonnement et de chat, et excelle dans les tâches bien définies qui պահանջent un raisonnement fiable, une langue précise et une sortie rapide pour le texte et les images.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT-5 nano

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-nano

Entrées prises en charge : texte, image

GPT-5 nano est un grand modèle de langage et un modèle de raisonnement de pointe à usage général, développé et entraîné par OpenAI. Il prend en charge les entrées multimodales et dispose d'une fenêtre de contexte totale de 400 000 jetons, avec un maximum de 128 000 jetons de sortie. Le modèle excelle dans les tâches à haut throughput, telles que le suivi d'instructions simples ou la classification pour les processus d'entreprise routiniers ou les applications mobiles.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 3.1 Flash Image

important

Consultez les Conditions applicables au modèle pour Gemini 3.1 Flash Image.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Ce modèle génère des images en sortie, en plus du texte. Google utilise des tarifs pass-through pour ce modèle, et les jetons d'image de sortie sont facturés séparément des jetons de texte de sortie. Consultez les tarifs de l'image Gemini 3.1 Flash de Google pour plus de détails.

Gemini 3.1 Flash Image est uniquement disponible via les Foundation Model APIs pay-per-token. Il n'est pas pris en charge pour le throughput provisionné, l'inférence par batch des AI Functions, ai_query ou AI Playground.

Nom de l'Endpoint : databricks-gemini-3-1-flash-image

Entrées prises en charge : texte, image

Gemini 3.1 Flash Image est le modèle Gemini de Google pour la génération d'images. Une seule requête peut renvoyer des images générées avec du texte. Ce modèle ne prend pas en charge l'appel de fonction.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Image Google Gemini 3 Pro

important

Voir les conditions applicables au modèle pour Gemini 3 Pro Image.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Ce modèle génère des images en sortie, en plus du texte. Google utilise des tarifs pass-through pour ce modèle, et les jetons d'image de sortie sont facturés séparément des jetons de texte de sortie. Consultez les tarifs de Google Gemini 3 Pro Image pour plus de détails.

Gemini 3 Pro Image est uniquement disponible via les APIs de modèle de fondation avec paiement par jeton. Il n'est pas pris en charge pour le throughput provisionné, l'inférence par batch des AI Functions, ai_query ou AI Playground.

Nom de l'Endpoint : databricks-gemini-3-pro-image

Entrées prises en charge : texte, image

Gemini 3 Pro Image est le modèle Gemini de génération d'images de Google. Une seule requête peut renvoyer des images générées avec du texte. Ce modèle ne prend pas en charge l'appel de fonction.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 3.1 Flash Lite

important

Consultez les Conditions applicables au modèle pour Gemini 3.1 Flash Lite.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-1-flash-lite

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.1 Flash Lite est le modèle le plus rapide et le plus économique de la série Gemini 3, développé et entraîné par Google. Conçu pour l'intelligence à grande échelle, le modèle prend en charge les entrées multimodales avec des capacités d'image, l'appel de fonction et une sortie structurée. Gemini 3,1 Flash Lite est optimisé pour les déploiements à haut throughput et rentables. En savoir plus sur Gemini 3.1 Flash Lite.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 3.6 Flash

important

Consultez les conditions applicables au modèle pour Gemini 3.6 Flash.

Nom de l'Endpoint : databricks-gemini-3-6-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.6 Flash est un modèle d'IA multimodal, rapide et rentable, développé et entraîné par Google. En tant que successeur de Gemini 3.5 Flash, ce modèle offre un raisonnement plus robuste, des capacités multimodales avancées et des performances de prix améliorées pour les déploiements à l'échelle de la production. Gemini 3.6 Flash est optimisé pour les charges de travail à haut throughput, telles que l'analyse vidéo complexe, l'extraction de données et les questions-réponses visuelles. En savoir plus sur Gemini 3.6 Flash.

Comme avec d'autres grands modèles de langage, la sortie de Gemini 3.6 Flash peut omettre certains faits et produire occasionnellement des informations erronées. Databricks recommande d'utiliser la génération augmentée de récupération (RAG) dans les scénarios où la précision est particulièrement importante.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 3.5 Flash

important

Voir les conditions applicables au modèle pour Gemini 3.5 Flash.

Nom de l'Endpoint : databricks-gemini-3-5-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.5 Flash est un modèle d'IA multimodal, rapide et économique, développé et entraîné par Google. En tant qu'amélioration significative par rapport à Gemini 3 Flash, ce modèle offre un raisonnement plus solide, des capacités multimodales avancées et une meilleure performance prix/déploiements à l'échelle de la production. Gemini 3.5 Flash est optimisé pour les workloads à haut throughput tels que l'analyse vidéo complexe, l'extraction de données et les questions et réponses visuelles. En savoir plus sur Gemini 3.5 Flash.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 3 Flash

important

Voir Conditions applicables au modèle pour Gemini 3 Flash.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3 Flash est un modèle d'IA multimodal rapide et économique, développé et entraîné par Google. Ce modèle offre rapidité et évolutivité sans compromettre la qualité, doté de capacités multimodales avancées pour l'analyse vidéo complexe, l'extraction de données et les questions-réponses visuelles en quasi temps réel. Gemini 3 Flash offre un meilleur rapport performance/prix et des vitesses plus rapides, permettant des déploiements à l'échelle de la production. En savoir plus sur Gemini 3 Flash.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 3.1 Pro (Préversion)

important

Consultez les conditions applicables au modèle pour Gemini 3.1 Pro Préversion.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-1-pro

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.1 Pro Preview est un modèle de raisonnement hybride de pointe, doté d'une fenêtre de contexte d'un million de jetons, développé et entraîné par Google. Il offre une grande capacité de raisonnement et d'intelligence documentaire, ce qui en fait un modèle intelligent global pour les workflows et les tâches complexes. Il excelle dans le raisonnement complexe, l'analyse approfondie et la compréhension multimodale sur un large éventail d'entrées et de tâches

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 2.5 Pro

important

Voir les conditions applicables au modèle pour le Gemini 2.5 Pro.

Google Gemini 2.5 Pro sera retiré le 2 octobre 2026. Consultez la page Modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et obtenir des conseils sur la migration pendant la période d'obsolescence.

Nom de l'Endpoint : databricks-gemini-2-5-pro

Entrées prises en charge : texte, image, vidéo, audio

Gemini 2.5 Pro est un modèle de raisonnement hybride avec une fenêtre de contexte d'un million de tokens, développé et entraîné par Google. Le « Deep Think Mode » de Gemini 2.5 Pro et sa sortie audio intégrée le distinguent comme un modèle de pointe pour les applications d'entreprise, de recherche et créatives. Il est conçu pour exceller en raisonnement complexe, en analyse approfondie et en compréhension multimodale sur un large éventail d'entrées et de tâches. En savoir plus sur Gemini 2.5 Pro.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Google Gemini 2.5 Flash

important

Consultez Conditions applicables au modèle pour Gemini 2.5 Flash.

Google Gemini 2.5 Flash est obsolète et son retrait est prévu pour le 2 octobre 2026. Consultez la page Modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et obtenir des conseils sur la migration pendant la période d'obsolescence.

Nom de l'Endpoint : databricks-gemini-2-5-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 2.5 Flash est un modèle d'IA multimodal, à haute vitesse et rentable, développé et entraîné par Google. Il s'agit du premier modèle de raisonnement entièrement hybride de Google, conçu pour les développeurs et les entreprises à la recherche de solutions d'IA rapides, évolutives et abordables. Gemini 2.5 Flash peut traiter jusqu'à 1 million de jetons dans un seul contexte, lui permettant de gérer des documents ou datasets extrêmement volumineux. Gemini 2.5 Flash est optimisé pour les applications en temps réel et à volume élevé, telles que les chatbots, l'extraction de données, la traduction et l'analyse de documents. En savoir plus sur Gemini 2.5 Flash.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Alibaba Cloud Qwen3.5 122B A10B

info

Aperçu

Le modèle Qwen3.5 122B A10B est en Aperçu public.

Nom de l'Endpoint : databricks-qwen35-122b-a10b

Entrées prises en charge : texte

Qwen3.5 122B A10B est un modèle de raisonnement hybride Mixture-of-Experts (MoE) conçu et entraîné par Alibaba Cloud, avec 122 milliards de paramètres au total et 10 milliards de paramètres actifs par inférence. Le modèle prend en charge une fenêtre de contexte de 256K et jusqu'à 8 000 jetons de sortie, et offre de solides performances pour les tâches de raisonnement, de codage et d'agent. En tant que modèle de raisonnement uniquement, Qwen3.5 122B A10B raisonne toujours avant de répondre, et le raisonnement ne peut pas être désactivé.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Alibaba Cloud Qwen3-Embedding-0.6B

info

Aperçu

Le modèle Qwen3-Embedding-0.6B est en Aperçu public.

Nom de l'Endpoint : databricks-qwen3-embedding-0-6b

Entrées prises en charge : texte

Qwen3-Embedding-0.6B est un modèle compact d’intégration de texte avec environ 600 M de paramètres, conçu pour des tâches sémantiques telles que la récupération, la recherche de similarité, le clustering et la classification. Il encode le texte en vecteurs denses qui représentent le sens plutôt que la forme de surface.

Le modèle prend en charge plus de 100 langues (y compris le code) et gère des contextes longs jusqu'à environ 32K tokens, ce qui le rend adapté à l'intégration de documents longs. Il produit des embeddings avec une dimensionnalité configurable jusqu'à 1024 et est sensible aux instructions, permettant un biais spécifique à la tâche par le biais de prompts.

Conçu sur un encodeur de transformateur et affiné spécifiquement pour la génération d'embeddings, Qwen3-Embedding-0,6B équilibre la qualité des embeddings et l'inférence efficace.

Les modèles d'intégration sont particulièrement efficaces lorsqu'ils sont utilisés conjointement avec des LLM pour les cas d'utilisation de génération augmentée de récupération (RAG). Qwen3-Embedding-0.6B peut être utilisé pour trouver des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d'un LLM.

Alibaba Cloud Qwen3-Next 80B A3B Instruct

info

Aperçu

Le modèle Qwen3-Next 80B A3B Instruct est en Aperçu public.

Nom de l'Endpoint : databricks-qwen3-next-80b-a3b-instruct

Entrées prises en charge : texte

Qwen3-Next-80B-A3B-Instruct est un grand modèle de langage très efficace optimisé pour les tâches de suivi d'instructions, conçu et entraîné par Alibaba Cloud. Ce modèle est conçu pour gérer des contextes ultra-longs et excelle dans les workflows multi-étapes, la génération augmentée par récupération et les applications d'entreprise qui nécessitent des sorties déterministes avec un throughput élevé.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Zhipu AI GLM 5.2

Nom de l'Endpoint : databricks-glm-5-2

Entrées prises en charge : texte

GLM-5.2 est un modèle de langage à architecture mixte d'experts (MoE) avec un total de 753 milliards de paramètres développé par Zhipu AI. Le modèle prend en charge une longueur de contexte de 1 million de jetons et est optimisé pour le raisonnement à long terme, le codage et l’utilisation d’outils d’agent.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

OpenAI GPT OSS 120B

Nom de l'Endpoint : databricks-gpt-oss-120b

Entrées prises en charge : texte

GPT OSS 120B est un modèle de raisonnement de pointe avec chaîne de pensée et niveaux d'effort de raisonnement réglables, développé et entraîné par OpenAI. C'est le modèle phare à poids ouvert d'OpenAI et il dispose d'une fenêtre de contexte de 128 000 jetons. Le modèle est conçu pour les tâches de raisonnement de haute qualité.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT OSS 20B

Nom de l'Endpoint : databricks-gpt-oss-20b

Entrées prises en charge : texte

GPT OSS 20B est un modèle de raisonnement léger et de pointe, développé et entraîné par OpenAI. Ce modèle dispose d'une fenêtre contextuelle de 128K jetons et excelle dans les copilotes en temps réel et les tâches d'inférence par batch.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemma 3 12B

important

Consultez les conditions applicables du modèle pour les conditions de Gemma 3 et la politique d'utilisation acceptable.

Nom de l'Endpoint : databricks-gemma-3-12b

Entrées prises en charge : texte, image

Gemma 3 12B est un modèle de langage multimodal et de vision de 12 milliards de paramètres développé par Google dans le cadre de la famille Gemma 3. Gemma 3 a un contexte de jetons allant jusqu'à 128 000 et offre une prise en charge multilingue pour plus de 140 langues. Ce modèle est conçu pour gérer à la fois des entrées de texte et d'image et générer des sorties de texte, et est optimisé pour les cas d'utilisation de dialogue, la génération de texte et les tâches de compréhension d'image, y compris la réponse aux questions.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Meta Llama 4 Maverick

important

Consultez les Conditions du modèle applicables pour la Licence Communautaire Llama 4 et la Politique d'utilisation acceptable.

Nom de l'Endpoint : databricks-llama-4-maverick

Entrées prises en charge : texte, image

Llama 4 Maverick est un grand modèle de langage de pointe, conçu et entraîné par Meta. C'est le premier de la famille de modèles Llama à utiliser une architecture de mélange d'experts pour l'efficacité du compute. Llama 4 Maverick prend en charge plusieurs langues et est optimisé pour les cas d'utilisation de compréhension précise d'images et de textes. En savoir plus sur Llama 4 Maverick.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Meta Llama 3.3 70B Instruct

important

À partir du 11 décembre 2024, Meta-Llama-3.3-70B-Instruct remplace la prise en charge de Meta-Llama-3.1-70B-Instruct dans les endpoints de paiement au jeton des APIs de modèles de fondation.

Voir Conditions de modèle applicables pour la licence et la politique d'utilisation acceptable de la Communauté LLama 3.3.

Nom de l'Endpoint : databricks-meta-llama-3-3-70b-instruct

Entrées prises en charge : texte

Meta-Llama-3.3-70B-Instruct est un grand modèle linguistique de pointe avec un contexte de 128 000 jetons, conçu et entraîné par Meta. Le modèle prend en charge plusieurs langues et est optimisé pour les cas d'utilisation de dialogue. En savoir plus sur le Meta Llama 3.3.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Meta Llama 3.1 405B Instruct

important

Meta-Llama-3.1-405B-Instruct sera retiré,

  • À partir du 15 février 2026 pour les charges de travail avec paiement par jeton.
  • À partir du 15 mai 2026 pour les charges de travail à throughput provisionné.

Consultez les modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et les instructions de migration pendant la dépréciation.

info

Aperçu

L'utilisation de ce modèle avec les APIs Foundation Model est en préversion publique. Contactez votre équipe de compte Databricks si vous rencontrez des défaillances d'Endpoint ou des erreurs de stabilisation lorsque vous utilisez ce modèle.

Voir les conditions de modèle applicables pour la Licence Communauté Llama 3.1 et la Politique d'utilisation acceptable.

Nom de l'Endpoint : databricks-meta-llama-3-1-405b-instruct

Entrées prises en charge : texte

Meta-Llama-3.1-405B-Instruct est le plus grand modèle de langage étendu de pointe disponible publiquement, développé et entraîné par Meta. L’utilisation de ce modèle permet aux clients de débloquer de nouvelles capacités, telles que le raisonnement avancé en plusieurs étapes et la génération de données synthétiques de haute qualité. Ce modèle est compétitif avec GPT-4-Turbo en termes de qualité.

À l'instar de Meta-Llama-3.1-70B-Instruct, Ce modèle a un contexte de 128 000 jetons et prend en charge dix langues. Il s’aligne sur les préférences humaines en matière d’utilité et de sécurité, et est optimisé pour les cas d’utilisation de dialogue. En savoir plus sur les modèles Meta Llama 3.1.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Meta Llama 3.1 8B Instruct

important

Consultez les conditions applicables au modèle pour connaître la licence Communauté LLama 3.1 et la politique d'utilisation acceptable.

Nom de l'Endpoint : databricks-meta-llama-3-1-8b-instruct

Entrées prises en charge : texte

Meta-Llama-3.1-8B-Instruct est un grand modèle de langage à la pointe de la technologie avec un contexte de 128 000 jetons, construit et entraîné par Meta. Le modèle prend en charge plusieurs langues et est optimisé pour les cas d'utilisation de dialogue. En savoir plus sur Meta Llama 3.1.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Haiku 4.5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-haiku-4-5

Entrées prises en charge : texte, image

Claude Haiku 4.5 est le modèle d'Anthropic le plus rapide et le plus rentable, offrant une qualité de codage proche de l'état de l'art avec une vitesse et une efficacité exceptionnelles. Il excelle dans les applications en temps réel et à faible latence, notamment les assistants de chat, les agents de service client, la programmation en binôme et le prototypage rapide. Ce modèle est idéal pour les déploiements de production soucieux des coûts et les systèmes agentiques nécessitant une assistance IA réactive.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Sonnet 5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-sonnet-5

Entrées prises en charge : texte, image

remarque

Claude Sonnet 5 ne prend pas en charge les parameters d'échantillonnage temperature, top_p ou top_k. Les requêtes qui incluent ces paramètres renvoient une erreur 400.

Claude Sonnet 5 est le modèle Sonnet le plus performant d'Anthropic, conçu pour le codage, les workflows d'agents et le travail professionnel à l'échelle de la montée en charge. Il combine une intelligence quasi-Opus avec l'efficacité des coûts et la vitesse de Sonnet, le rendant bien adapté aux agents en contact avec les clients, aux workflows de codage de production et aux tâches sophistiquées de génération de contenu.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Sonnet 4.6

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-sonnet-4-6

Entrées prises en charge : texte, image

Claude Sonnet 4,6 est le modèle de raisonnement hybride le plus avancé d'Anthropic. Il offre deux modes : des réponses quasi instantanées et une réflexion approfondie pour un raisonnement plus poussé en fonction de la complexité de la tâche. Claude Sonnet 4.6 est spécialisé dans les applications qui nécessitent un équilibre entre un throughput pratique et une réflexion avancée, telles que les agents en contact avec les clients, les flux de travail de codage en production et la génération de contenu à grande échelle.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Sonnet 4.5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-sonnet-4-5

Entrées prises en charge : texte, image

Claude Sonnet 4.5 est le modèle de raisonnement hybride le plus avancé d'Anthropic. Il offre deux modes : des réponses quasi instantanées et une réflexion approfondie pour un raisonnement plus poussé en fonction de la complexité de la tâche. Claude Sonnet 4.5 est spécialisé dans les applications qui nécessitent un équilibre entre un throughput pratique et une réflexion avancée, telles que les agents en contact avec les clients, les workflows de codage de production et la génération de contenu à grande échelle.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Fable 5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

important

Pour Claude Fable 5, les prompts et les réponses sont conservés pendant 30 jours à des fins de confiance et de sécurité. Ces données sont traitées par des systèmes de sécurité automatisés et peuvent, dans certains cas, être signalées pour un examen humain. Les données sont supprimées automatiquement après 30 jours, sauf en cas d'enquête de sécurité ou d'exigences légales de conservation des données au-delà de 30 jours. Anthropic est un sous-traitant limité à des fins de conservation pour la sécurité.

Nom de l'Endpoint : databricks-claude-fable-5

Entrées prises en charge : texte

Claude Fable 5 est un modèle de classe Mythos d'Anthropic conçu pour le travail autonome de la connaissance et le codage. Avec des garanties robustes intégrées, il peut gérer des tâches de longue durée, complexes et asynchrones avec moins de contrôles humains que les modèles précédents, ce qui le rend bien adapté aux flux de travail agentiques qui nécessitent une concentration soutenue sur des contextes étendus.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Opus 4.8

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-8

Entrées prises en charge : texte, image

Claude Opus 4.8 est le modèle de raisonnement hybride le plus performant d'Anthropic, s'appuyant sur la série Opus avec des améliorations supplémentaires en matière de précision, d'efficacité et de capacités de raisonnement. Ce modèle excelle dans les tâches complexes d'extraction et de raisonnement agentique avec prise en charge d'images, ce qui le rend idéal pour les applications d'entreprise qui nécessitent une analyse approfondie, une compréhension de documents et des workflows multi-étapes sophistiqués.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Opus 4.7

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-7

Entrées prises en charge : texte, image

Claude Opus 4.7 est le modèle de raisonnement hybride le plus performant d'Anthropic, faisant progresser la série Opus avec une précision, une efficacité et des capacités de vision améliorées. Ce modèle offre des performances accrues sur les tâches d'extraction complexe et de raisonnement agentique, tout en utilisant moins de jetons de sortie que son prédécesseur. Claude Opus 4.7 offre une fenêtre contextuelle d'un million de tokens et une prise en charge améliorée de la résolution d'image, ce qui le rend idéal pour les applications d'entreprise qui nécessitent une analyse approfondie, une compréhension des documents et des workflows multi-étapes sophistiqués.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Opus 4.6

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-6

Entrées prises en charge : texte, image

Claude Opus 4.6 est le modèle de raisonnement hybride le plus performant d'Anthropic, doté de capacités de réflexion adaptatives. Ce modèle introduit un nouveau niveau d'effort maximal pour les tâches les plus exigeantes, avec un effort élevé défini par default pour des performances optimales. Claude Opus 4.6 excelle en raisonnement complexe, en analyse approfondie, en génération de code, en recherche et en workflows sophistiqués en plusieurs étapes. Il offre une fenêtre de contexte d'1 million de jetons, ce qui le rend idéal pour les applications d'entreprise qui nécessitent à la fois une analyse approfondie et des sorties complètes.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Opus 4.5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-5

Entrées prises en charge : texte, image

Claude Opus 4.5 est le modèle de raisonnement hybride le plus performant d'Anthropic, conçu pour les tâches les plus complexes nécessitant une analyse approfondie et une réflexion étendue. Ce modèle combine de puissantes capacités à usage général avec un raisonnement avancé, excellant dans la génération de code, la recherche, la création de contenu et les workflows agentiques multi-étapes sophistiqués. Claude Opus 4,5 prend en charge les entrées de texte et de vision avec une fenêtre contextuelle de 200 000 tokens, ce qui le rend idéal pour les applications d'entreprise qui exigent à la fois une compréhension large et approfondie.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Sonnet 4

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Anthropic Claude Sonnet 4 est obsolète. Consultez Modèles obsolètes et retirés pour connaître sa date de retrait, le modèle de remplacement recommandé et des conseils sur la façon de migrer pendant la dépréciation.

Nom de l'Endpoint : databricks-claude-sonnet-4

Entrées prises en charge : texte, image

Claude Sonnet 4 est un modèle de raisonnement hybride de pointe, construit et entraîné par Anthropic. Ce modèle offre deux modes : des réponses quasi instantanées et une réflexion approfondie pour un raisonnement plus profond basé sur la complexité de la tâche. Claude Sonnet 4 est optimisé pour diverses tâches telles que le développement de code, l'analyse de contenu à grande échelle et le développement d'applications d'agents.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Anthropic Claude Opus 4.1

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-1

Entrées prises en charge : texte, image

Claude Opus 4.1 est un modèle de raisonnement hybride de pointe construit et entraîné par Anthropic. Ce grand modèle de langage à usage général est conçu à la fois pour le raisonnement complexe et les applications réelles à l'échelle de l'entreprise. Il prend en charge les entrées texte et image, avec une fenêtre de contexte de 200K jetons et des capacités de sortie de 32K jetons. Ce modèle excelle dans des tâches telles que la génération de code, la recherche et la création de contenu, ainsi que les workflows d'agents multi-étapes sans intervention humaine constante.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

Thinking Machine Labs Inkling

info

Aperçu

Inkling est en aperçu public.

Nom de l'Endpoint : databricks-inkling

Entrées prises en charge : texte, image

Inkling est un modèle linguistique de mélange d'experts (MoE) avec 975 milliards de paramètres totaux et 41 milliards de paramètres actifs, développé par Thinking Machine Labs. Le modèle prend en charge une longueur de contexte de 1 million de jetons et est optimisé pour le codage, le raisonnement et les tâches d'utilisation d'outils agentiques.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Cet Endpoint est hébergé par Databricks au sein du périmètre de sécurité de Databricks.

GTE Large (Fr)

Nom de l'Endpoint : databricks-gte-large-en

Entrées prises en charge : texte

Le modèle General Text Embedding (GTE) est un modèle d'intégration de texte qui peut mapper n'importe quel texte à un vecteur d'intégration de 1024 dimensions et à une fenêtre d'intégration de 8192 jetons. Ces vecteurs peuvent être utilisés dans les index de vecteurs pour les LLM, et pour des tâches telles que la récupération, la classification, les questions-réponses, le clustering ou la recherche sémantique. Cet Endpoint sert la version anglaise du modèle et ne génère pas d'intégrations normalisées.

Les modèles d'intégration sont particulièrement efficaces lorsqu'ils sont utilisés conjointement avec des LLM pour les cas d'utilisation de génération augmentée de récupération (RAG). GTE peut être utilisé pour trouver des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d'un LLM.

BGE Large

Nom de l'Endpoint : databricks-bge-large-en

Entrées prises en charge : texte

Le modèle BAAI General Embedding (BGE) est un modèle d'intégration de texte qui peut mapper n'importe quel texte à un vecteur d'intégration de 1024 dimensions et à une fenêtre d'intégration de 512 jetons. Ces vecteurs peuvent être utilisés dans les index de vecteurs pour les LLM, et pour des tâches telles que la récupération, la classification, les questions-réponses, le clustering ou la recherche sémantique. Cet Endpoint sert la version anglaise du modèle et génère des intégrations normalisées.

Les modèles d'intégration sont particulièrement efficaces lorsqu'ils sont utilisés conjointement avec des LLM pour les cas d'utilisation de génération augmentée de récupération (RAG). BGE peut être utilisé pour trouver des extraits de texte pertinents dans de grands segments de documents qui peuvent être utilisés dans le contexte d'un LLM.

Dans les applications RAG, vous pouvez améliorer les performances de votre système de récupération en incluant un paramètre d'instruction. Les auteurs du BGE recommandent d'essayer l'instruction "Represent this sentence for searching relevant passages:" pour les embeddings de query, bien que son impact sur les performances dépende du domaine.

Ressources supplémentaires