Aller au contenu principal

Modèles de fondation hébergés par Databricks disponibles dans les API Foundation Model

Cet article décrit les modèles ouverts de pointe qui sont pris en charge par les API de modèles de fondation Databricks.

remarque

Consultez Modèles de fondation pris en charge sur Model Serving pour connaître la disponibilité régionale de ces modèles et les fonctionnalités prises en charge.

Vous pouvez envoyer des requêtes de query à ces modèles en utilisant les Endpoints de paiement au jeton disponibles dans votre Workspace Databricks. Consultez Utiliser les modèles de fondation et le tableau des modèles pris en charge par paiement au jeton pour connaître les noms des Endpoint de modèle à utiliser.

En plus de prendre en charge les modèles en mode paiement au jeton, les APIs de modèle de fondation offrent également un mode throughput provisionné. Databricks recommande le throughput provisionné pour les charges de travail de production. Ce mode prend en charge tous les modèles d'une famille d'architecture de modèles, y compris les modèles affinés et pré-entraînés personnalisés pris en charge en mode paiement au jeton. Voir les APIs de modèle de fondation avec throughput provisionné pour la liste des architectures prises en charge.

Vous pouvez interagir avec ces modèles pris en charge à l'aide de l'AI Playground.

Pour les modèles OpenAI, Google Gemini et Anthropic, la fenêtre de contexte et le nombre maximal de jetons de sortie correspondent aux valeurs publiées par le fournisseur de modèle respectif.

OpenAI GPT-5.6 Sol

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-6-sol

Entrées prises en charge : texte, image

GPT-5.6 Sol, également appelé GPT-5.6, est le modèle phare d'OpenAI dans la famille GPT-5.6, offrant des performances de pointe en matière de codage agentique, de raisonnement à long terme et d'utilisation d'outils complexes, avec la prise en charge d'un nouvel effort de raisonnement maximal. Ce modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.6 Terra

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-6-terra

Entrées prises en charge : texte, image

GPT-5.6 Terra est le modèle équilibré de la famille GPT-5.6 d'OpenAI pour les charges de travail quotidiennes basées sur des agents et le raisonnement, offrant des performances compétitives par rapport à GPT-5.5 à un coût inférieur. Ce modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.6 Luna

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-6-luna

Entrées prises en charge : texte, image

GPT-5.6 Luna est le modèle rapide et économique de la famille GPT-5.6 d'OpenAI, offrant des capacités de raisonnement et d'agent puissantes au coût le plus bas de la gamme. Ce modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.5 Pro

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

GPT-5.5 Pro utilise la mise en cache étendue des prompts. Les tenseurs mis en cache sont stockés dans le stockage local au GPU pendant 24 heures seulement.

remarque

Ce modèle n'est pas pris en charge dans AI Playground. Utilisez l'API Responses pour interagir avec ce modèle.

Nom de l'Endpoint : databricks-gpt-5-5-pro

Entrées prises en charge : texte, image

GPT-5.5 Pro est une variante de GPT-5.5 offrant une plus grande précision, destinée aux problèmes les plus complexes, notamment la recherche approfondie, les mathématiques avancées et le raisonnement à enjeux élevés. Ce modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.5

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

GPT-5.5 utilise la mise en cache étendue des prompts. Les tenseurs mis en cache sont stockés dans le stockage local au GPU pendant 24 heures seulement.

remarque

Ce modèle n'est pas pris en charge dans AI Playground. Utilisez l'API Responses pour interagir avec ce modèle.

Nom de l'Endpoint : databricks-gpt-5-5

Entrées prises en charge : texte, image

GPT-5.5 est le modèle de pointe le plus puissant d’OpenAI pour les workflows d’agents d’entreprise, le raisonnement complexe sur documents et les agents de codage à long terme. GPT-5.5 alimente également Codex, l’agent de codage d’OpenAI. Ce modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.4

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-4

Entrées prises en charge : texte, image

GPT-5.4 est un grand modèle de langage polyvalent doté de capacités de raisonnement, développé par OpenAI. Il offre de meilleures performances sur les tâches complexes, avec une précision accrue et un raisonnement structuré plus délibéré. Ce modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.4 Mini

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-4-mini

Entrées prises en charge : texte, image

GPT-5.4 mini est un grand modèle de langage polyvalent et optimisé en termes de coûts, doté de capacités de raisonnement et développé par OpenAI. Basé sur le GPT-5.4 architecture, ce modèle offre des performances améliorées sur des tâches bien définies qui nécessitent un raisonnement fiable, un langage précis et une sortie rapide. Il prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.4 nano

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-4-nano

Entrées prises en charge : texte, image

GPT-5.4 nano est un grand modèle de langage polyvalent doté de capacités de raisonnement développé par OpenAI. Basé sur le GPT-5.4 architecture, ce modèle excelle dans les tâches à haut throughput comme le suivi d'instructions simples ou la classification pour des processus métier courants ou des applications mobiles. Il prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.3 Codex

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

remarque

Ce modèle n'est pas pris en charge dans AI Playground. Utilisez l'API Responses pour interagir avec ce modèle.

Nom de l'Endpoint : databricks-gpt-5-3-codex

Entrées prises en charge : texte, image

GPT-5.3 Codex est le modèle de codage agentique le plus avancé d’OpenAI, conçu pour gérer des tâches complexes et de longue durée impliquant la recherche, l’utilisation d’outils et l’exécution. Il associe des performances de codage de pointe au raisonnement et aux connaissances professionnelles de GPT-5.2, tout en fonctionnant 25 % plus rapidement. Le modèle prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.2

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-2

Entrées prises en charge : texte, image

GPT-5.2 est un grand modèle de langage polyvalent doté de capacités de raisonnement, développé par OpenAI. Ce modèle s'appuie directement sur GPT-5.1, offrant une précision accrue, une meilleure efficacité des jetons sur les tâches de complexité moyenne à élevée, ainsi qu'un raisonnement structuré plus délibéré. Ce modèle excelle dans l'extraction structurée, les flux de travail en plusieurs étapes et les tâches multimodales. Il prend en charge les entrées multimodales.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5.1

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-1

Entrées prises en charge : texte, image

GPT-5.1 est un grand modèle de langage polyvalent doté de capacités de raisonnement, développé par OpenAI. Ce modèle propose les modes Instantané et Réflexion pour une conversation rapide ou un raisonnement approfondi, s'adaptant automatiquement aux tâches simples ou complexes. Le modèle excelle dans la création de contenu, le tutorat, le support technique et le codage, en s'appuyant moins sur un Data Engineering de prompt strict que les versions précédentes. Il prend en charge les entrées multimodales. En savoir plus sur GPT-5.1.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5

Entrées prises en charge : texte, image

GPT-5 est un grand modèle de langage et de raisonnement polyvalent et de pointe, conçu et entraîné par OpenAI. Il prend en charge les entrées multimodales. Le modèle est conçu pour le codage, le chat, le raisonnement et les tâches pilotées par des agents.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5 Mini

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-mini

Entrées prises en charge : texte, image

GPT-5 mini est un grand modèle de langage et de raisonnement polyvalent et de pointe, conçu et entraîné par OpenAI. Il prend en charge les entrées multimodales. Le modèle est optimisé en termes de coûts pour les charges de travail de raisonnement et de chat, et excelle dans les tâches bien définies qui nécessitent un raisonnement fiable, un langage précis et une sortie rapide pour le texte et les images.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT-5 nano

important

Les clients sont responsables de garantir leur conformité avec les conditions applicables au modèle.

Nom de l'Endpoint : databricks-gpt-5-nano

Entrées prises en charge : texte, image

GPT-5 nano est un grand modèle de langage et un modèle de raisonnement polyvalent de pointe, construit et entraîné par OpenAI. Il prend en charge les entrées multimodales. Le modèle excelle dans les tâches à haut throughput telles que le suivi d’instructions simples ou la classification pour des processus métier courants ou des applications mobiles.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 3.1 Flash Image

important

Consultez les Conditions applicables au modèle pour Gemini 3.1 Flash Image.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Ce modèle génère des images en sortie, en plus du texte. Google utilise des tarifs pass-through pour ce modèle, et les jetons d'image de sortie sont facturés séparément des jetons de texte de sortie. Consultez les tarifs de l'image Gemini 3.1 Flash de Google pour plus de détails.

Gemini 3.1 Flash Image est uniquement disponible via les Foundation Model APIs pay-per-token. Il n'est pas pris en charge pour le throughput provisionné, l'inférence par batch des AI Functions, ai_query ou AI Playground.

Nom de l'Endpoint : databricks-gemini-3-1-flash-image

Entrées prises en charge : texte, image

Gemini 3.1 Flash Image est le modèle Gemini de Google pour la génération d'images. Une seule requête peut renvoyer des images générées avec du texte. Ce modèle ne prend pas en charge l'appel de fonction.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Image Google Gemini 3 Pro

important

Voir les conditions applicables au modèle pour Gemini 3 Pro Image.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Ce modèle génère des images en sortie, en plus du texte. Google utilise des tarifs pass-through pour ce modèle, et les jetons d'image de sortie sont facturés séparément des jetons de texte de sortie. Consultez les tarifs de Google Gemini 3 Pro Image pour plus de détails.

Gemini 3 Pro Image est uniquement disponible via les APIs de modèle de fondation avec paiement par jeton. Il n'est pas pris en charge pour le throughput provisionné, l'inférence par batch des AI Functions, ai_query ou AI Playground.

Nom de l'Endpoint : databricks-gemini-3-pro-image

Entrées prises en charge : texte, image

Gemini 3 Pro Image est le modèle Gemini de génération d'images de Google. Une seule requête peut renvoyer des images générées avec du texte. Ce modèle ne prend pas en charge l'appel de fonction.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 3.1 Flash Lite

important

Consultez les Conditions applicables au modèle pour Gemini 3.1 Flash Lite.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-1-flash-lite

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.1 Flash Lite est le modèle le plus rapide et le plus économique de la série Gemini 3, développé et entraîné par Google. Conçu pour l'intelligence à grande échelle, le modèle prend en charge les entrées multimodales avec des capacités d'image, l'appel de fonction et une sortie structurée. Gemini 3,1 Flash Lite est optimisé pour les déploiements à haut throughput et rentables. En savoir plus sur Gemini 3.1 Flash Lite.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 3.5 Flash Lite

important

Consultez les conditions de modèle applicables pour Gemini 3.5 Flash Lite.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-5-flash-lite

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.5 Flash Lite est le modèle le plus rapide et le plus rentable de la série Gemini 3, développé et entraîné par Google. Conçu pour l'intelligence à grande échelle, le modèle prend en charge les entrées multimodales avec des capacités d'image, l'appel de fonction et une sortie structurée. Gemini 3.5 Flash Lite est optimisé pour les déploiements à throughput élevé et rentables.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 3.6 Flash

important

Consultez les conditions applicables au modèle pour Gemini 3.6 Flash.

Nom de l'Endpoint : databricks-gemini-3-6-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.6 Flash est un modèle d'IA multimodal, rapide et rentable, développé et entraîné par Google. En tant que successeur de Gemini 3.5 Flash, ce modèle offre un raisonnement plus robuste, des capacités multimodales avancées et des performances de prix améliorées pour les déploiements à l'échelle de la production. Gemini 3.6 Flash est optimisé pour les charges de travail à haut throughput, telles que l'analyse vidéo complexe, l'extraction de données et les questions-réponses visuelles. En savoir plus sur Gemini 3.6 Flash.

Comme avec d'autres grands modèles de langage, la sortie de Gemini 3.6 Flash peut omettre certains faits et produire occasionnellement des informations erronées. Databricks recommande d'utiliser la génération augmentée de récupération (RAG) dans les scénarios où la précision est particulièrement importante.

Google Gemini 3.5 Flash

important

Voir les conditions applicables au modèle pour Gemini 3.5 Flash.

Nom de l'Endpoint : databricks-gemini-3-5-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.5 Flash est un modèle d'IA multimodal, rapide et économique, développé et entraîné par Google. En tant qu'amélioration significative par rapport à Gemini 3 Flash, ce modèle offre un raisonnement plus solide, des capacités multimodales avancées et une meilleure performance prix/déploiements à l'échelle de la production. Gemini 3.5 Flash est optimisé pour les workloads à haut throughput tels que l'analyse vidéo complexe, l'extraction de données et les questions et réponses visuelles. En savoir plus sur Gemini 3.5 Flash.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 3 Flash

important

Voir Conditions applicables au modèle pour Gemini 3 Flash.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3 Flash est un modèle d'IA multimodal rapide et économique, développé et entraîné par Google. Ce modèle offre rapidité et évolutivité sans compromettre la qualité, doté de capacités multimodales avancées pour l'analyse vidéo complexe, l'extraction de données et les questions-réponses visuelles en quasi temps réel. Gemini 3 Flash offre un meilleur rapport performance/prix et des vitesses plus rapides, permettant des déploiements à l'échelle de la production. En savoir plus sur Gemini 3 Flash.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 3.1 Pro (Préversion)

important

Consultez les conditions applicables au modèle pour Gemini 3.1 Pro Préversion.

Ce modèle est hébergé sur un Endpoint global et nécessite l'activation du routage inter-géographique.

Nom de l'Endpoint : databricks-gemini-3-1-pro

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.1 Pro Preview est un modèle de raisonnement hybride de pointe développé et entraîné par Google. Il offre un raisonnement puissant et une intelligence documentaire, ce qui en fait un modèle globalement intelligent pour les workflows et les tâches complexes. Il excelle dans le raisonnement complexe, l'analyse approfondie et la compréhension multimodale sur un large éventail d'entrées et de tâches

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 2.5 Pro

important

Voir les conditions applicables au modèle pour le Gemini 2.5 Pro.

Google Gemini 2.5 Pro sera retiré le 2 octobre 2026. Consultez la page Modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et obtenir des conseils sur la migration pendant la période d'obsolescence.

Nom de l'Endpoint : databricks-gemini-2-5-pro

Entrées prises en charge : texte, image, vidéo, audio

Gemini 2.5 Pro est un modèle de raisonnement hybride développé et entraîné par Google. Le « Deep Think Mode » et la sortie audio intégrée de Gemini 2.5 Pro le distinguent comme un modèle de premier plan pour les applications d'entreprise, de recherche et créatives. Il est conçu pour exceller dans le raisonnement complexe, l'analyse approfondie et la compréhension multimodale sur un large éventail d'entrées et de tâches. En savoir plus sur Gemini 2.5 Pro.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemini 2.5 Flash

important

Consultez Conditions applicables au modèle pour Gemini 2.5 Flash.

Google Gemini 2.5 Flash est obsolète et son retrait est prévu pour le 2 octobre 2026. Consultez la page Modèles obsolètes et retirés pour connaître le modèle de remplacement recommandé et obtenir des conseils sur la migration pendant la période d'obsolescence.

Nom de l'Endpoint : databricks-gemini-2-5-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 2.5 Flash est un modèle d'IA multimodal, rapide et économique, développé et entraîné par Google. Il s'agit du premier modèle de raisonnement entièrement hybride de Google, conçu pour les développeurs et les entreprises à la recherche de solutions d'IA rapides, évolutives et abordables. Gemini 2.5 Flash est optimisé pour les applications en temps réel et à haut volume telles que les chatbots, l'extraction de données, la traduction et l'analyse de documents. En savoir plus sur Gemini 2.5 Flash.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Alibaba Cloud Qwen3.5 122B A10B

info

Aperçu

Le modèle Qwen3.5 122B A10B est en Aperçu public.

Nom de l'Endpoint : databricks-qwen35-122b-a10b

Entrées prises en charge : texte

Qwen3.5 122B A10B est un modèle de raisonnement hybride Mixture-of-Experts (MoE) conçu et entraîné par Alibaba Cloud, avec 122 milliards de paramètres au total et 10 milliards de paramètres actifs par inférence. Le modèle prend en charge une fenêtre de contexte de 256K et jusqu'à 25K jetons de sortie, et offre de solides performances en matière de raisonnement, de codage et de tâches d'agent. En tant que modèle dédié uniquement au raisonnement, Qwen3.5 122B A10B raisonne toujours avant de répondre, et le raisonnement ne peut pas être désactivé.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Alibaba Cloud Qwen3-Embedding-0.6B

info

Aperçu

Le modèle Qwen3-Embedding-0.6B est en Aperçu public.

Nom de l'Endpoint : databricks-qwen3-embedding-0-6b

Entrées prises en charge : texte

Qwen3-Embedding-0.6B est un modèle compact d’intégration de texte avec environ 600 M de paramètres, conçu pour des tâches sémantiques telles que la récupération, la recherche de similarité, le clustering et la classification. Il encode le texte en vecteurs denses qui représentent le sens plutôt que la forme de surface.

Le modèle prend en charge plus de 100 langues (y compris le code) et gère des contextes longs jusqu'à environ 32K tokens, ce qui le rend adapté à l'intégration de documents longs. Il produit des embeddings avec une dimensionnalité configurable jusqu'à 1024 et est sensible aux instructions, permettant un biais spécifique à la tâche par le biais de prompts.

Conçu sur un encodeur de transformateur et affiné spécifiquement pour la génération d'embeddings, Qwen3-Embedding-0,6B équilibre la qualité des embeddings et l'inférence efficace.

Les modèles d'intégration sont particulièrement efficaces lorsqu'ils sont utilisés conjointement avec des LLM pour les cas d'utilisation de génération augmentée de récupération (RAG). Qwen3-Embedding-0.6B peut être utilisé pour trouver des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d'un LLM.

Alibaba Cloud Qwen3-Next 80B A3B Instruct

info

Aperçu

Le modèle Qwen3-Next 80B A3B Instruct est en Aperçu public.

Nom de l'Endpoint : databricks-qwen3-next-80b-a3b-instruct

Entrées prises en charge : texte

Qwen3-Next-80B-A3B-Instruct est un grand modèle de langage très efficace optimisé pour les tâches de suivi d'instructions, conçu et entraîné par Alibaba Cloud. Ce modèle est conçu pour gérer des contextes ultra-longs et excelle dans les workflows multi-étapes, la génération augmentée par récupération et les applications d'entreprise qui nécessitent des sorties déterministes avec un throughput élevé.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Zhipu AI GLM 5.2

Nom de l'Endpoint : databricks-glm-5-2

Entrées prises en charge : texte

GLM-5.2 est un modèle de langage à architecture mixte d'experts (MoE) avec un total de 753 milliards de paramètres développé par Zhipu AI. Le modèle prend en charge une longueur de contexte de 1 million de jetons et est optimisé pour le raisonnement à long terme, le codage et l’utilisation d’outils d’agent.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT OSS 120B

Nom de l'Endpoint : databricks-gpt-oss-120b

Entrées prises en charge : texte

GPT OSS 120B est un modèle de raisonnement de pointe avec chaîne de pensée et niveaux d'effort de raisonnement réglables, développé et entraîné par OpenAI. C'est le modèle phare à poids ouvert d'OpenAI et il dispose d'une fenêtre de contexte de 128 000 jetons. Le modèle est conçu pour les tâches de raisonnement de haute qualité.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

OpenAI GPT OSS 20B

Nom de l'Endpoint : databricks-gpt-oss-20b

Entrées prises en charge : texte

GPT OSS 20B est un modèle de raisonnement léger et de pointe, développé et entraîné par OpenAI. Ce modèle dispose d'une fenêtre contextuelle de 128K jetons et excelle dans les copilotes en temps réel et les tâches d'inférence par batch.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Google Gemma 3 12B

important

Consultez les conditions applicables du modèle pour les conditions de Gemma 3 et la politique d'utilisation acceptable.

Nom de l'Endpoint : databricks-gemma-3-12b

Entrées prises en charge : texte, image

Gemma 3 12B est un modèle de langage multimodal et de vision de 12 milliards de paramètres développé par Google dans le cadre de la famille Gemma 3. Gemma 3 a un contexte de jetons allant jusqu'à 128 000 et offre une prise en charge multilingue pour plus de 140 langues. Ce modèle est conçu pour gérer à la fois des entrées de texte et d'image et générer des sorties de texte, et est optimisé pour les cas d'utilisation de dialogue, la génération de texte et les tâches de compréhension d'image, y compris la réponse aux questions.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Meta Llama 3.3 70B Instruct

Nom de l'Endpoint : databricks-meta-llama-3-3-70b-instruct

Entrées prises en charge : texte

Meta-Llama-3.3-70B-Instruct est un grand modèle linguistique de pointe avec un contexte de 128 000 jetons, conçu et entraîné par Meta. Le modèle prend en charge plusieurs langues et est optimisé pour les cas d'utilisation de dialogue. En savoir plus sur le Meta Llama 3.3.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Haiku 4.5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-haiku-4-5

Entrées prises en charge : texte, image

Claude Haiku 4.5 est le modèle d'Anthropic le plus rapide et le plus rentable, offrant une qualité de codage proche de l'état de l'art avec une vitesse et une efficacité exceptionnelles. Il excelle dans les applications en temps réel et à faible latence, notamment les assistants de chat, les agents de service client, la programmation en binôme et le prototypage rapide. Ce modèle est idéal pour les déploiements de production soucieux des coûts et les systèmes agentiques nécessitant une assistance IA réactive.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Sonnet 5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-sonnet-5

Entrées prises en charge : texte, image

remarque

Claude Sonnet 5 ne prend pas en charge les parameters d'échantillonnage temperature, top_p ou top_k. Les requêtes qui incluent ces paramètres renvoient une erreur 400.

Claude Sonnet 5 est le modèle Sonnet le plus performant d'Anthropic, conçu pour le codage, les workflows d'agents et le travail professionnel à l'échelle de la montée en charge. Il combine une intelligence quasi-Opus avec l'efficacité des coûts et la vitesse de Sonnet, le rendant bien adapté aux agents en contact avec les clients, aux workflows de codage de production et aux tâches sophistiquées de génération de contenu.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Sonnet 4.6

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-sonnet-4-6

Entrées prises en charge : texte, image

Claude Sonnet 4,6 est le modèle de raisonnement hybride le plus avancé d'Anthropic. Il offre deux modes : des réponses quasi instantanées et une réflexion approfondie pour un raisonnement plus poussé en fonction de la complexité de la tâche. Claude Sonnet 4.6 est spécialisé dans les applications qui nécessitent un équilibre entre un throughput pratique et une réflexion avancée, telles que les agents en contact avec les clients, les flux de travail de codage en production et la génération de contenu à grande échelle.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Sonnet 4.5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-sonnet-4-5

Entrées prises en charge : texte, image

Claude Sonnet 4.5 est le modèle de raisonnement hybride le plus avancé d'Anthropic. Il offre deux modes : des réponses quasi instantanées et une réflexion approfondie pour un raisonnement plus poussé en fonction de la complexité de la tâche. Claude Sonnet 4.5 est spécialisé dans les applications qui nécessitent un équilibre entre un throughput pratique et une réflexion avancée, telles que les agents en contact avec les clients, les workflows de codage de production et la génération de contenu à grande échelle.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Fable 5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

important

Pour Claude Fable 5, les prompts et les réponses sont conservés pendant 30 jours à des fins de confiance et de sécurité. Ces données sont traitées par des systèmes de sécurité automatisés et peuvent, dans certains cas, être signalées pour un examen humain. Les données sont supprimées automatiquement après 30 jours, sauf en cas d'enquête de sécurité ou d'exigences légales de conservation des données au-delà de 30 jours. Anthropic est un sous-traitant limité à des fins de conservation pour la sécurité.

Nom de l'Endpoint : databricks-claude-fable-5

Entrées prises en charge : texte

Claude Fable 5 est un modèle de classe Mythos d'Anthropic conçu pour le travail autonome de la connaissance et le codage. Avec des garanties robustes intégrées, il peut gérer des tâches de longue durée, complexes et asynchrones avec moins de contrôles humains que les modèles précédents, ce qui le rend bien adapté aux flux de travail agentiques qui nécessitent une concentration soutenue sur des contextes étendus.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Opus 5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-5

Entrées prises en charge : texte, image

Claude Opus 5 est le modèle de raisonnement hybride le plus performant d'Anthropic, s'appuyant sur la série Opus et axé sur le codage agentique, l'examen de code et le travail autonome à long terme. Ce modèle excelle dans les tâches logicielles complexes et multifichiers telles que les refactorisations importantes et le développement de fonctionnalités de bout en bout, la détection de bogues de haute précision, la coordination multi-agents et les tâches de vision comme la compréhension de diagrammes, de documents et d'interfaces utilisateur. Claude Opus 5 maintient un suivi rigoureux des instructions, l’appel d’outils et le raisonnement sur l’ensemble de la fenêtre de contexte, et offre une qualité quasi optimale avec un effort de raisonnement faible ou moyen, ce qui le rend parfaitement adapté aux flux de travail d’entreprise à long contexte et sensibles aux coûts.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Opus 4.8

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-8

Entrées prises en charge : texte, image

Claude Opus 4.8 s'appuie sur la série Opus avec des améliorations supplémentaires en matière de précision, d'efficacité et de capacités de raisonnement. Ce modèle excelle dans les tâches d'extraction complexe et de raisonnement agentique avec prise en charge des images, ce qui le rend idéal pour les applications d'entreprise qui nécessitent une analyse approfondie, la compréhension de documents et des workflows multi-étapes sophistiqués.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Opus 4.7

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-7

Entrées prises en charge : texte, image

Claude Opus 4.7 est le modèle de raisonnement hybride le plus performant d'Anthropic, faisant progresser la série Opus avec une précision, une efficacité et des capacités de vision améliorées. Ce modèle offre de meilleures performances sur les tâches complexes d'extraction et de raisonnement agentique tout en utilisant moins de jetons de sortie que son prédécesseur. Claude Opus 4.7 prend en charge une résolution d'image accrue, ce qui le rend idéal pour les applications d'entreprise nécessitant une analyse approfondie, une compréhension de documents et des workflows complexes en plusieurs étapes.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Opus 4.6

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-6

Entrées prises en charge : texte, image

Claude Opus 4.6 est le modèle de raisonnement hybride le plus performant d'Anthropic, doté de capacités de réflexion adaptatives. Ce modèle introduit un nouveau niveau d'effort maximal pour les tâches les plus exigeantes, avec un effort élevé défini par default pour des performances optimales. Claude Opus 4.6 excelle dans le raisonnement complexe, l’analyse approfondie, la génération de code, la recherche et les flux de travail sophistiqués en plusieurs étapes. Il est idéal pour les applications d’entreprise qui nécessitent à la fois une analyse approfondie et des résultats complets.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Opus 4.5

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-5

Entrées prises en charge : texte, image

Claude Opus 4.5 est le modèle de raisonnement hybride le plus performant d’Anthropic, conçu pour les tâches les plus complexes nécessitant une analyse approfondie et une réflexion étendue. Ce modèle associe de puissantes capacités polyvalentes à un raisonnement avancé, excellant dans la génération de code, la recherche, la création de contenu et les flux de travail agentiques sophistiqués en plusieurs étapes. Claude Opus 4.5 prend en charge les entrées texte et vision, ce qui le rend idéal pour les applications d’entreprise exigeant à la fois une grande étendue et une grande profondeur de compréhension.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Sonnet 4

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Anthropic Claude Sonnet 4 est obsolète. Consultez Modèles obsolètes et retirés pour connaître sa date de retrait, le modèle de remplacement recommandé et des conseils sur la façon de migrer pendant la dépréciation.

Nom de l'Endpoint : databricks-claude-sonnet-4

Entrées prises en charge : texte, image

Claude Sonnet 4 est un modèle de raisonnement hybride de pointe, construit et entraîné par Anthropic. Ce modèle offre deux modes : des réponses quasi instantanées et une réflexion approfondie pour un raisonnement plus profond basé sur la complexité de la tâche. Claude Sonnet 4 est optimisé pour diverses tâches telles que le développement de code, l'analyse de contenu à grande échelle et le développement d'applications d'agents.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Anthropic Claude Opus 4.1

important

Les clients sont responsables d’assurer leur conformité aux conditions de la politique d’utilisation d’Anthropic.

Nom de l'Endpoint : databricks-claude-opus-4-1

Entrées prises en charge : texte, image

Claude Opus 4.1 est un modèle de raisonnement hybride de pointe, conçu et entraîné par Anthropic. Ce grand modèle de langage polyvalent est conçu à la fois pour le raisonnement complexe et pour les applications réelles pour Monter en charge en entreprise. Il prend en charge la saisie de texte et d'images. Ce modèle excelle dans des tâches telles que la génération de code, la recherche et la création de contenu, ainsi que dans les flux de travail d'agents en plusieurs étapes sans intervention humaine constante.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

Thinking Machine Labs Inkling

info

Aperçu

Inkling est en aperçu public.

Nom de l'Endpoint : databricks-inkling

Entrées prises en charge : texte, image

Inkling est un modèle linguistique de mélange d'experts (MoE) avec 975 milliards de paramètres totaux et 41 milliards de paramètres actifs, développé par Thinking Machine Labs. Le modèle prend en charge une longueur de contexte de 1 million de jetons et est optimisé pour le codage, le raisonnement et les tâches d'utilisation d'outils agentiques.

Les modèles d'IA peuvent faire des erreurs, mal comprendre les intentions, et avoir des hallucinations ou donner des réponses incorrectes. Databricks recommande aux clients d'évaluer leurs modèles pour s'assurer qu'ils fonctionnent comme prévu.

GTE Large (Fr)

Nom de l'Endpoint : databricks-gte-large-en

Entrées prises en charge : texte

Le modèle General Text Embedding (GTE) est un modèle d'intégration de texte qui peut mapper n'importe quel texte à un vecteur d'intégration de 1024 dimensions et à une fenêtre d'intégration de 8192 jetons. Ces vecteurs peuvent être utilisés dans les index de vecteurs pour les LLM, et pour des tâches telles que la récupération, la classification, les questions-réponses, le clustering ou la recherche sémantique. Cet Endpoint sert la version anglaise du modèle et ne génère pas d'intégrations normalisées.

Les modèles d'intégration sont particulièrement efficaces lorsqu'ils sont utilisés conjointement avec des LLM pour les cas d'utilisation de génération augmentée de récupération (RAG). GTE peut être utilisé pour trouver des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d'un LLM.

Ressources supplémentaires