Modelos básicos hospedados pela Databricks disponíveis nas APIs de modelos básicos
Este artigo descreve os modelos abertos de última geração que são suportados pelo Modelo de FundaçãoDatabricks APIs.
Consulte a seção "Modelos básicos suportados" no Serving Modelo para obter informações sobre a disponibilidade regional desses modelos e as áreas de recursos suportadas.
O senhor pode enviar solicitações de consulta a esses modelos usando o endpoint pay-per-tokens disponível em seu site Databricks workspace. Consulte a tabela Use foundation models and pay-per-tokens supported models para obter os nomes do endpoint do modelo a ser usado.
Além de suportar modelos no modo de pagamento por tokens, APIs do Foundation Model também oferecem o modo de provisionamento Taxa de transferência. Databricks recomenda o provisionamento Taxa de transferência para cargas de trabalho de produção. Este modo suporta todos os modelos de uma família de arquitetura de modelos, incluindo os modelos pré-treinados personalizados e ajustados que são suportados no modo de pagamento por tokens. Consulte provisionamento Taxa de transferência APIsdo Foundation Model para obter a lista de arquiteturas suportadas.
O senhor pode interagir com esses modelos suportados usando o AI Playground.
Para modelos da OpenAI, Google Gemini e Anthropic, a janela de contexto e os tokens de saída máximos correspondem aos valores publicados pelo respectivo provedor do modelo.
OpenAI GPT-5.6 Sol
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-6-sol
Entradas suportadas : texto, imagem
O GPT-5.6 Sol, também referido como GPT-5.6, é o modelo principal da OpenAI na família GPT-5.6, oferecendo desempenho de ponta em codificação agêntica, raciocínio de longo prazo e uso complexo de ferramentas, com suporte para um novo esforço máximo de raciocínio. Este modelo suporta entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.6 Terra
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-6-terra
Entradas suportadas : texto, imagem
O GPT-5.6 Terra é o modelo equilibrado na família GPT-5.6 da OpenAI para cargas de trabalho diárias de agentes e raciocínio, oferecendo desempenho competitivo com o GPT-5.5 a um custo menor. Este modelo suporta entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.6 Luna
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-6-luna
Entradas suportadas : texto, imagem
O GPT-5.6 Luna é o modelo rápido e econômico da família GPT-5.6 da OpenAI, trazendo forte capacidade de raciocínio e agentic ao menor custo da linha. Este modelo suporta entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.5 Pro
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
O GPT-5.5 Pro utiliza cache de prompts estendido. Os tensores em cache são armazenados no armazenamento local da GPU por no máximo 24 horas.
Este modelo não é compatível com o AI Playground. Utilize a API de Respostas para interagir com este modelo.
Nome do ponto de extremidade : databricks-gpt-5-5-pro
Entradas suportadas : texto, imagem
GPT-5.5 Pro é uma variante de maior precisão do GPT-5.5 voltada para os problemas mais difíceis, incluindo pesquisa profunda, matemática avançada e raciocínio de alto risco. Este modelo oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.5
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
O GPT-5.5 utiliza cache de prompts estendido. Os tensores em cache são armazenados no armazenamento local da GPU por no máximo 24 horas.
Este modelo não é compatível com o AI Playground. Utilize a API de Respostas para interagir com este modelo.
Nome do ponto de extremidade : databricks-gpt-5-5
Entradas suportadas : texto, imagem
GPT-5.5 é o modelo de fronteira mais forte da OpenAI para fluxos de trabalho de agentes corporativos, raciocínio complexo de documentos e agentes de codificação de longo prazo. O GPT-5.5 também impulsiona o Codex, o agente de codificação da OpenAI. Este modelo oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.4
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-4
Entradas suportadas : texto, imagem
GPT-5.4 é um modelo de linguagem grande de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Ele oferece desempenho aprimorado em tarefas complexas com maior precisão e raciocínio estruturado mais deliberado. Este modelo oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.4 mini
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-4-mini
Entradas suportadas : texto, imagem
O GPT-5.4 mini é um grande modelo de linguagem de uso geral otimizado para custos com capacidades de raciocínio desenvolvidas pela OpenAI. Criado com base no GPT-5.4 arquitetura, este modelo oferece desempenho aprimorado em tarefas bem definidas que exigem raciocínio confiável, linguagem precisa e saída rápida. Ele oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.4 nano
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-4-nano
Entradas suportadas : texto, imagem
O GPT-5.4 nano é um modelo de linguagem grande de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Criado com base no GPT-5.4 arquitetura, este modelo se destaca em tarefas de alto throughput, como seguir instruções simples ou classificação para processos de negócios rotineiros ou aplicativos móveis. Ele oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.3 Códice
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Este modelo não é compatível com o AI Playground. Utilize a API de Respostas para interagir com este modelo.
Nome do ponto de extremidade : databricks-gpt-5-3-codex
Entradas suportadas : texto, imagem
O GPT-5.3 Codex é o modelo de codificação agente mais avançado da OpenAI, projetado para lidar com tarefas complexas e de longa duração que envolvem pesquisa, uso de ferramentas e execução. Ele combina desempenho de codificação de fronteira com o raciocínio e o conhecimento profissional do GPT-5.2, operando 25% mais rápido. O modelo oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.2
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-2
Entradas suportadas : texto, imagem
O GPT-5.2 é um modelo de linguagem grande de uso geral com capacidades de raciocínio desenvolvido pela OpenAI. Este modelo é baseado diretamente no GPT-5.1, oferecendo maior precisão, eficiência de tokens aprimorada em tarefas de média a alta complexidade e um raciocínio estruturado mais deliberado. Este modelo se destaca em extração estruturada, fluxos de trabalho de várias etapas e tarefas multimodais. Ele oferece suporte a entradas multimodais.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5.1
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-1
Entradas suportadas : texto, imagem
O GPT-5.1 é um grande modelo de linguagem de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Este modelo apresenta ambos os recursos Instantâneo e de Pensamento para conversas rápidas ou raciocínio profundo, ajustando-se automaticamente para tarefas simples ou complexas. O modelo se destaca na criação de conteúdo, tutoria, suporte técnico e codificação, com menos dependência de engenharia de prompt rigorosa do que as versões anteriores. Ele oferece suporte a entradas multimodais. Saiba mais sobre o GPT-5.1.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5
Entradas suportadas : texto, imagem
O GPT-5 é um modelo de linguagem grande e modelo de raciocínio de uso geral de última geração, criado e treinado pela OpenAI. Ele oferece suporte a entradas multimodais. O modelo foi criado para codificação, chat, raciocínio e tarefas orientadas por agentes.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5 mini
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-mini
Entradas suportadas : texto, imagem
O GPT-5 mini é um grande modelo de linguagem e modelo de raciocínio de uso geral de última geração, criado e treinado pela OpenAI. Ele oferece suporte a entradas multimodais. O modelo é otimizado em termos de custo para cargas de trabalho de raciocínio e chat, e se destaca em tarefas bem definidas que exigem raciocínio confiável, linguagem precisa e saída rápida para texto e imagens.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT-5 nano
Os clientes são responsáveis por garantir a compliance com os termos do modelo aplicáveis.
Nome do ponto de extremidade : databricks-gpt-5-nano
Entradas suportadas : texto, imagem
O GPT-5 nano é um modelo de linguagem grande e modelo de raciocínio de uso geral de última geração, criado e treinado pela OpenAI. Ele oferece suporte a entradas multimodais. O modelo se destaca em tarefas de alto throughput, como o seguimento simples de instruções ou classificação para processos de negócios rotineiros ou aplicativos móveis.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3.6 Flash
Consulte Termos aplicáveis ao modelo para Gemini 3.6 Flash.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Nome do ponto de extremidade : databricks-gemini-3-6-flash
Entradas suportadas : texto, imagem, vídeo, áudio
O Gemini 3.6 Flash é um modelo de AI multimodal de alta velocidade e custo eficiente, desenvolvido e treinado pelo Google. Como sucessor do Gemini 3.5 Flash, este modelo oferece raciocínio mais forte, recursos multimodais avançados e desempenho de preço aprimorado para implantações em escala de produção. O Gemini 3.6 Flash é otimizado para cargas de trabalho de alto throughput, como análise de vídeo complexa, extração de dados e Q&As visuais. Saiba mais sobre o Gemini 3.6 Flash.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3.5 Flash
Consulte os termos de modelo aplicáveis para Gemini 3.5 Flash.
Nome do ponto de extremidade : databricks-gemini-3-5-flash
Entradas suportadas : texto, imagem, vídeo, áudio
Gemini 3.5 Flash é um modelo AI multimodal, de alta velocidade e baixo custo, desenvolvido e treinado pelo Google. Como um avanço significativo em relação ao Gemini 3 Flash, este modelo oferece raciocínio mais robusto, recursos multimodais avançados e melhor desempenho em termos de custo para implantações em escala de produção. O Gemini 3.5 Flash é otimizado para cargas de trabalho de alta taxa de transferência, como análise complexa de vídeo, extração de dados e perguntas e respostas visuais. Saiba mais sobre o Gemini 3.5 Flash.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3.5 Flash Lite
Consulte Termos de modelo aplicáveis para o Gemini 3.5 Flash Lite.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Nome do ponto de extremidade : databricks-gemini-3-5-flash-lite
Entradas suportadas : texto, imagem, vídeo, áudio
O Gemini 3.5 Flash Lite é o modelo mais rápido e com melhor custo-benefício da série Gemini 3, desenvolvido e treinado pelo Google. O modelo oferece suporte a entradas multimodais com recursos de imagem, chamada de função e saída estruturada. O Gemini 3.5 Flash Lite é otimizado para implantações de alto throughput e com bom custo-benefício.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Prévia do Google Gemini 3.1 Pro
Consulte os termos de modelo aplicáveis para a versão de pré-visualização do Gemini 3.1 Pro.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Nome do ponto de extremidade : databricks-gemini-3-1-pro
Entradas suportadas : texto, imagem, vídeo, áudio
O Gemini 3.1 Pro Preview é um modelo de raciocínio híbrido de última geração desenvolvido e treinado pelo Google. Ele oferece um raciocínio robusto e inteligência de documentos, tornando-o um modelo inteligente para fluxos de trabalho e tarefas complexas. Ele se destaca em raciocínio complexo, análise profunda e compreensão multimodal em uma ampla variedade de entradas e tarefas.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3.1 Flash Image
Consulte os termos do modelo aplicáveis para Gemini 3.1 Flash Image.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Este modelo gera imagens como saída, além de texto. O Google usa preços de repasse para este modelo, e os tokens de imagem de saída são faturados separadamente dos tokens de texto de saída. Consulte os preços da imagem Gemini 3.1 Flash do Google para obter detalhes.
O Gemini 3.1 Flash Image está disponível apenas por meio das APIs do Foundation Model com pagamento por token. Não é compatível com taxa de transferência provisionada, inferência em lotes do AI Functions, ai_query ou AI Playground.
Nome do ponto de extremidade : databricks-gemini-3-1-flash-image
Entradas suportadas : texto, imagem
O Gemini 3.1 Flash Image é o modelo Gemini de geração de imagens do Google. Uma única solicitação pode retornar imagens geradas juntamente com o texto. Este modelo não é compatível com chamada de função.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3.1 Flash Lite
Consulte os termos de modelo aplicáveis para o Gemini 3.1 Flash Lite.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Nome do ponto de extremidade : databricks-gemini-3-1-flash-lite
Entradas suportadas : texto, imagem, vídeo, áudio
O Gemini 3.1 Flash Lite é o modelo mais rápido e econômico da série Gemini 3, desenvolvido e treinado pelo Google. Construído para inteligência em grande escala, o modelo suporta entradas multimodais com recursos de imagem, chamada de funções e saída estruturada. O Gemini 3.1 Flash Lite foi otimizado para implantações de alta taxa de transferência e baixo custo. Saiba mais sobre o Gemini 3.1 Flash Lite.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3 Pro Image
Consulte Termos aplicáveis ao modelo para Gemini 3 Pro Image.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Este modelo gera imagens como saída, além de texto. O Google usa preços de repasse para este modelo, e os tokens de imagem de saída são faturados separadamente dos tokens de texto de saída. Consulte os preços da imagem Gemini 3 Pro do Google para obter detalhes.
O Gemini 3 Pro Image está disponível apenas por meio das APIs do Foundation Model com pagamento por token. Não é compatível com taxa de transferência provisionada, inferência em lotes do AI Functions, ai_query ou AI Playground.
Nome do ponto de extremidade : databricks-gemini-3-pro-image
Entradas suportadas : texto, imagem
O Gemini 3 Pro Image é o modelo Gemini de geração de imagens do Google. Uma única solicitação pode retornar imagens geradas junto com texto. Este modelo não é compatível com chamada de função.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 3 Flash
Consulte os termos de modelo aplicáveis para Gemini 3 Flash.
Este modelo está hospedado em um endpoint global e requer que o roteamento entre diferentes regiões geográficas esteja habilitado.
Nome do ponto de extremidade : databricks-gemini-3-flash
Entradas suportadas : texto, imagem, vídeo, áudio
Gemini 3 Flash é um modelo AI multimodal de alta velocidade e baixo custo, desenvolvido e treinado pelo Google. Este modelo oferece velocidade e escalabilidade sem comprometer a qualidade, além de recursos multimodais avançados para análise complexa de vídeo, extração de dados e perguntas e respostas visuais em tempo quase real. O Gemini 3 Flash oferece melhor desempenho em termos de preço e velocidades mais rápidas, permitindo implantações em escala de produção. Saiba mais sobre o Gemini 3 Flash.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 2.5 Pro
Consulte os termos de modelo aplicáveis para o Gemini 2.5 Pro.
O Google Gemini 2.5 Pro será descontinuado em 2 de outubro de 2026. Consulte Modelos obsoletos e descontinuados para obter o modelo de substituição recomendado e orientação sobre como migrar durante a descontinuação.
Nome do ponto de extremidade : databricks-gemini-2-5-pro
Entradas suportadas : texto, imagem, vídeo, áudio
O Gemini 2.5 Pro é um modelo de raciocínio híbrido desenvolvido e treinado pelo Google. O "Deep Think Mode" e a saída de áudio integrada do Gemini 2.5 Pro o destacam como um modelo líder para aplicações empresariais, de pesquisa e criativas. Ele foi projetado para se destacar em raciocínio complexo, análise profunda e compreensão multimodal em uma ampla gama de entradas e tarefas. Saiba mais sobre o Gemini 2.5 Pro.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemini 2.5 Flash
Consulte os termos de modelo aplicáveis para o Gemini 2.5 Flash.
Google Gemini 2.5 Flash foi descontinuado e está planejado para ser desativado em 2 de outubro de 2026. Consulte Modelos obsoletos e descontinuados para obter o modelo de substituição recomendado e orientação sobre como migrar durante a descontinuação.
Nome do ponto de extremidade : databricks-gemini-2-5-flash
Entradas suportadas : texto, imagem, vídeo, áudio
O Gemini 2.5 Flash é um modelo de AI multimodal, de alta velocidade e custo-eficiente, desenvolvido e treinado pelo Google. É o primeiro modelo de raciocínio totalmente híbrido do Google, projetado para desenvolvedores e empresas que buscam soluções de AI rápidas, escaláveis e acessíveis. O Gemini 2.5 Flash é otimizado para aplicativos de tempo real e de alto volume, como chatbots, extração de dados, tradução e análise de documentos. Saiba mais sobre o Gemini 2.5 Flash.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Alibaba Cloud Qwen3.5 122B A10B
Visualização
O modelo Qwen3.5 122B A10B está em Pré-visualização Pública.
Nome do ponto de extremidade : databricks-qwen35-122b-a10b
Entradas suportadas : texto
O Qwen3.5 122B A10B é um modelo de raciocínio híbrido Mixture-of-Experts (MoE) criado e treinado pela Alibaba Cloud, com 122 bilhões de parâmetros totais e 10 bilhões de parâmetros ativos por inferência. O modelo suporta uma janela de contexto de 256K e até 25K tokens de saída, e oferece um forte desempenho em tarefas de raciocínio, codificação e agentic. Como um modelo apenas de raciocínio, o Qwen3.5 122B A10B sempre raciocina antes de responder, e o raciocínio não pode ser desativado.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Alibaba Cloud Qwen3-Embedding-0.6B
Visualização
O modelo Qwen3-Embedding-0.6B está em Pré-visualização Pública.
Nome do ponto de extremidade : databricks-qwen3-embedding-0-6b
Entradas suportadas : texto
O Qwen3-Embedding-0.6B é um modelo compacto de incorporação de texto com cerca de 600 milhões de parâmetros, projetado para tarefas semânticas como recuperação, busca por similaridade, clustering e classificação. Ele codifica o texto em vetores densos que representam o significado em vez da forma superficial.
O modelo suporta mais de 100 idiomas (incluindo código) e lida com contextos longos de até aproximadamente 32 mil tokens, tornando-o adequado para incorporar documentos extensos. Ele produz representações vetoriais com dimensionalidade configurável de até 1024 e reconhece instruções, permitindo o direcionamento específico para cada tarefa por meio de sugestões.
Baseado em um codificador Transformer e ajustado especificamente para geração de embeddings, o Qwen3-Embedding-0.6B equilibra a qualidade do embedding com a eficiência da inferência.
Os modelos de incorporação são especialmente eficazes quando usados em conjunto com LLMs para casos de uso de geração aumentada por recuperação (RAG). O Qwen3-Embedding-0.6B pode ser usado para encontrar trechos de texto relevantes em grandes blocos de documentos que podem ser usados no contexto de um mestrado em direito (LLM).
Instrução Alibaba Cloud Qwen3-Next 80B A3B
Visualização
O modelo Qwen3-Next 80B A3B Instruct está em Pré-visualização Pública.
Nome do ponto de extremidade : databricks-qwen3-next-80b-a3b-instruct
Entradas suportadas : texto
Qwen3-Next-80B-A3B-Instruct é um modelo de linguagem grande e altamente eficiente, otimizado para tarefas de acompanhamento de instruções, criado e treinado pela Alibaba Cloud. Este modelo foi projetado para lidar com contextos ultralongos e se destaca em fluxo de trabalho multietapas, geração aumentada de recuperação e aplicativos corporativos que exigem saídas determinísticas em altas taxas de transferência.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Zhipu AI GLM 5.2
Nome do ponto de extremidade : databricks-glm-5-2
Entradas suportadas : texto
GLM-5.2 é um modelo de linguagem de mistura de especialistas (MoE) com 753 bilhões de parâmetros totais desenvolvido pela Zhipu AI. O modelo suporta um comprimento de contexto de 1 milhão de tokens e é otimizado para raciocínio de longo alcance, codificação e uso de ferramentas de agente.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Moonshot AI Kimi K3
Nome do ponto de extremidade : databricks-kimi-k3
Entradas suportadas : texto, imagem
O Kimi K3 é um modelo de 2,8 trilhões de parâmetros desenvolvido pela Moonshot AI com capacidades nativas de visão. O modelo suporta um tamanho de contexto de 1 milhão de tokens e foi projetado para codificação de longo prazo, trabalho de conhecimento e raciocínio.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT OSS 120B
Nome do ponto de extremidade : databricks-gpt-oss-120b
Entradas suportadas : texto
O GPT OSS 120B é um modelo de raciocínio de última geração com cadeia de pensamento e níveis de esforço de raciocínio ajustáveis, criado e treinado pela OpenAI. É o principal modelo de peso aberto da OpenAI e oferece uma janela de contexto de 128 mil tokens. O modelo é construído para tarefas de raciocínio de alta qualidade.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
OpenAI GPT OSS 20B
Nome do ponto de extremidade : databricks-gpt-oss-20b
Entradas suportadas : texto
O GPT OSS 20B é um modelo de raciocínio leve e de última geração, construído e treinado pela OpenAI. Este modelo possui uma janela de contexto de 128K tokens e se destaca em copilotos em tempo real e tarefas de inferência em lotes.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Google Gemma 3 12B
Consulte os termos do modelo aplicável para obter os termos do Gemma 3 e a Política de Uso Aceitável.
Nome do ponto de extremidade : databricks-gemma-3-12b
Entradas suportadas : texto, imagem
Gemma 3 12B é um modelo de linguagem multimodal e de visão de 12 bilhões de parâmetros desenvolvido pelo Google como parte da família Gemma 3. O Gemma 3 tem um contexto de até 128 mil tokens e fornece suporte multilíngue para mais de 140 idiomas. Este modelo foi projetado para lidar com entradas de texto e imagem e gerar saídas de texto, além de ser otimizado para casos de uso de diálogo, geração de texto e tarefas de compreensão de imagem, incluindo resposta a perguntas.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Meta Llama 4 Maverick
Consulte os termos do modelo aplicáveis para a Licença Llama 4 comunidade e a Política de Uso Aceitável.
Nome do ponto de extremidade : databricks-llama-4-maverick
Entradas suportadas : texto, imagem
Llama 4 Maverick é um modelo de linguagem de última geração para grandes linguagens, construído e treinado pela Meta. É o primeiro modelo da família Llama a utilizar uma arquitetura que combina diferentes especialistas para otimizar a eficiência compute . O Llama 4 Maverick suporta vários idiomas e é otimizado para casos de uso de compreensão precisa de imagens e textos. Saiba mais sobre a Llama 4 Maverick.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Meta Llama 3.3 70B Instruct
A partir de 11 de dezembro de 2024, Meta-Llama-3.3-70B-Instruct Substitui o suporte para Meta-Llama-3.1-70B-Instruct no modelo Foundation APIs pay-per-tokens endpoint.
Consulte os termos do modelo aplicáveis para a Licença e Política de Uso Aceitável do LLama 3.3 comunidade.
Nome do ponto de extremidade : databricks-meta-llama-3-3-70b-instruct
Entradas suportadas : texto
O Meta-Llama-3.3-70B-Instruct é um modelo de linguagem grande de última geração com um contexto de 128.000 tokens que foi criado e treinado pelo Meta. O modelo oferece suporte a vários idiomas e é otimizado para casos de uso de diálogo. Saiba mais sobre o Meta Llama 3.3.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Meta Llama 3.1 8B Instruct
Consulte os termos do modelo aplicáveis para a Licença LLama 3.1 comunidade e a Política de Uso Aceitável.
Nome do ponto de extremidade : databricks-meta-llama-3-1-8b-instruct
Entradas suportadas : texto
O Meta-Llama-3.1-8B-Instruct é um modelo de linguagem grande de última geração com um contexto de 128.000 tokens que foi criado e treinado pelo Meta. O modelo oferece suporte a vários idiomas e é otimizado para casos de uso de diálogo. Saiba mais sobre o Meta Llama 3.1.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Haicai Anthropic de Claude 4.5
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-haiku-4-5
Entradas suportadas : texto, imagem
Claude Haiku 4.5 é o modelo mais rápido e econômico da Anthropic, oferecendo qualidade de codificação próxima à vanguarda com velocidade e eficiência excepcionais. É excelente para aplicações de alta velocidade e baixa latência, incluindo assistentes de bate-papo, agentes de atendimento ao cliente, programação em pares e prototipagem rápida. Este modelo é ideal para implantações de produção com custos controlados e sistemas com agentes que exigem assistência AI responsiva.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Anthropic Claude Sonnet 5
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-sonnet-5
Entradas suportadas : texto, imagem
Claude Sonnet 5 não oferece suporte aos parâmetros de amostragem temperature, top_p ou top_k. As solicitações que incluem esses parâmetros retornam um erro 400.
O Claude Sonnet 5 é o modelo Sonnet mais capaz da Anthropic, projetado para codificação, fluxos de trabalho agentic e trabalho profissional em escala. Ele combina inteligência de nível quase-Opus com a eficiência de custo e velocidade do Sonnet, tornando-o adequado para agentes de atendimento ao cliente, fluxos de trabalho de codificação de produção e tarefas sofisticadas de geração de conteúdo.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Soneto Anthropic de Claude 4.6
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-sonnet-4-6
Entradas suportadas : texto, imagem
Claude Sonnet 4.6 é o modelo de raciocínio híbrido mais avançado da Anthropic. Oferece dois modos: respostas quase instantâneas e raciocínio prolongado para uma análise mais profunda, baseada na complexidade da tarefa. Claude Sonnet 4.6 é especializado em aplicações que exigem um equilíbrio entre a prática e o pensamento avançado, como agentes voltados para o cliente, codificação de produção e geração de conteúdo em escala.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Soneto Anthropic de Claude 4.5
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-sonnet-4-5
Entradas suportadas : texto, imagem
Claude Sonnet 4.5 é o modelo de raciocínio híbrido mais avançado da Anthropic. Ele oferece dois modos: respostas quase instantâneas e pensamento estendido para raciocínio mais profundo com base na complexidade da tarefa. Claude Sonnet 4.5 é especialista em aplicações que exigem um equilíbrio entre pensamento prático e avançado, como agentes de atendimento ao cliente, fluxo de trabalho de codificação de produção e geração de conteúdo em escala.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Anthropic Claude Fable 5
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Para Claude Fable 5, instruções e respostas são retidas por 30 dias para fins de confiança e segurança. Esses dados são processados por sistemas de segurança automatizados e podem, em certas instâncias, ser sinalizados para revisão humana. Os dados são excluídos automaticamente após 30 dias, exceto em caso de uma investigação de segurança, ou de requisitos legais para reter os dados por mais de 30 dias. Anthropic é um subprocessador limitado para este fim de retenção de segurança.
Nome do ponto de extremidade : databricks-claude-fable-5
Entradas suportadas : texto
Claude Fable 5 é um modelo da classe Mythos da Anthropic projetado para trabalho de conhecimento autônomo e codificação. Com salvaguardas robustas integradas, ele pode lidar com tarefas de longa duração, complexas e assíncronas com menor necessidade de intervenções humanas do que modelos anteriores, o que o torna bem adequado para fluxos de trabalho agênticos que exigem atenção contínua em contextos ampliados.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Anthropic Claude Opus 5
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-opus-5
Entradas suportadas : texto, imagem
Claude Opus 5 é o modelo de raciocínio híbrido mais capaz da Anthropic, baseado na série Opus, com foco em codificação agentiva, revisão de código e trabalho autônomo de longo prazo. Este modelo se destaca em tarefas complexas de software de múltiplos arquivos, como grandes refatorações e desenvolvimento de recursos de ponta a ponta, detecção de bugs de alta precisão, coordenação multiagente e tarefas de visão, como compreensão de gráficos, documentos e interface de usuário. O Claude Opus 5 mantém um forte seguimento de instruções, chamada de ferramentas e raciocínio em toda a janela de contexto, e oferece uma qualidade quase superior com esforço de raciocínio baixo e médio, tornando-o bem adequado para fluxos de trabalho corporativos de contexto longo e sensíveis a custos.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Anthropic Claude Opus 4.8
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-opus-4-8
Entradas suportadas : texto, imagem
Claude Opus 4.8 se baseia na série Opus com melhorias adicionais na precisão, eficiência e capacidade de raciocínio. Este modelo se destaca em tarefas complexas de extração e raciocínio agentivo com suporte a imagens, tornando-o ideal para aplicações empresariais que exigem análise aprofundada, compreensão de documentos e fluxos de trabalho sofisticados em várias etapas.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Claude Anthropic Claude Opus 4.7
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-opus-4-7
Entradas suportadas : texto, imagem
O Claude Opus 4.7 é o modelo de raciocínio híbrido mais capaz da Anthropic, avançando a série Opus com maior precisão, eficiência e recursos aprimorados de visão. Este modelo oferece um desempenho mais forte em tarefas complexas de extração e raciocínio agente, usando menos tokens de saída do que seu predecessor. O Claude Opus 4.7 apresenta recursos de suporte a maior resolução de imagem, tornando-o ideal para aplicações empresariais que exigem análise profunda, compreensão de documentos e fluxos de trabalho complexos de várias etapas.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Claude Anthropic Opus 4.6
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-opus-4-6
Entradas suportadas : texto, imagem
O Claude Opus 4.6 é o modelo de raciocínio híbrido mais capaz da Anthropic, com capacidades de pensamento adaptativo. Este modelo introduz um novo nível de esforço máximo para as tarefas mais exigentes, com o esforço alto definido como default para um desempenho ideal. O Claude Opus 4.6 se destaca em raciocínio complexo, análise profunda, geração de código, pesquisa e fluxos de trabalho sofisticados em várias etapas. É ideal para aplicativos corporativos que exigem análise extensa e saídas abrangentes.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Claude Anthropic Opus 4.5
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-opus-4-5
Entradas suportadas : texto, imagem
O Claude Opus 4.5 é o modelo de raciocínio híbrido mais capaz da Anthropic, criado para as tarefas mais complexas que exigem análise profunda e raciocínio estendido. Este modelo combina recursos poderosos de uso geral com raciocínio avançado, destacando-se na geração de código, pesquisa, criação de conteúdo e fluxos de trabalho agenticos sofisticados de várias etapas. O Claude Opus 4.5 oferece suporte a entradas de texto e visão, tornando-o ideal para aplicativos corporativos que exigem amplitude e profundidade de compreensão.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Anthropic Claude Soneto 4
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Anthropic Claude Sonnet 4 está descontinuado. Consulte Modelos descontinuados e aposentados para a data de descontinuação, o modelo de substituição recomendado e a orientação sobre como migrar durante a descontinuação.
Nome do ponto de extremidade : databricks-claude-sonnet-4
Entradas suportadas : texto, imagem
O Claude Sonnet 4 é um modelo de raciocínio híbrido de última geração, criado e treinado pela Anthropic. Esse modelo oferece dois modos: respostas quase instantâneas e pensamento ampliado para um raciocínio mais profundo com base na complexidade da tarefa. O Claude Sonnet 4 é otimizado para várias tarefas, como desenvolvimento de código, análise de conteúdo de grande escala e desenvolvimento de aplicativos de agentes.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Anthropic Claude Opus 4.1
Os clientes são responsáveis por garantir o compliance dos termos da política de utilização da Anthropic.
Nome do ponto de extremidade : databricks-claude-opus-4-1
Entradas suportadas : texto, imagem
O Claude Opus 4.1 é um modelo de raciocínio híbrido de última geração, criado e treinado pela Anthropic. Este grande modelo de linguagem de uso geral foi projetado tanto para raciocínio complexo quanto para aplicações do mundo real em escala empresarial. Ele oferece suporte a entrada de texto e imagem. Este modelo se destaca em tarefas como geração de código, pesquisa e criação de conteúdo, além de fluxos de trabalho de agentes de várias etapas sem intervenção humana constante.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
Thinking Machine Labs Inkling
Visualização
O Inkling está em Pré-lançamento público.
Nome do ponto de extremidade : databricks-inkling
Entradas suportadas : texto, imagem
Inkling é um modelo de linguagem de mistura de especialistas (MoE) com 975 bilhões de parâmetros totais e 41 bilhões de parâmetros ativos, desenvolvido pela Thinking Machine Labs. O modelo suporta um comprimento de contexto de 1 milhão de tokens e é otimizado para codificação, raciocínio e tarefas de uso de ferramentas de agente.
Modelos de AI podem cometer erros, interpretar mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem seus modelos para garantir que estejam operando como pretendido.
GTE Large (En)
Nome do ponto de extremidade : databricks-gte-large-en
Entradas suportadas : texto
O General Text Embedding (GTE) é um modelo de incorporação de texto que pode mapear qualquer texto para um vetor de incorporação de 1024 dimensões e uma janela de incorporação de 8192 tokens. Esses vetores podem ser usados em índices de vetores para LLMs e para tarefas como recuperação, classificação, resposta a perguntas, clustering ou pesquisa semântica. Esse endpoint serve a versão em inglês do modelo e não gera embeddings normalizados.
Os modelos de incorporação são especialmente eficazes quando usados em conjunto com LLMs para casos de uso de geração aumentada de recuperação (RAG). O GTE pode ser usado para encontrar trechos de texto relevantes em grandes blocos de documentos que podem ser usados no contexto de um LLM.
BGE Grande (En)
Nome do ponto de extremidade : databricks-bge-large-en
Entradas suportadas : texto
O BAAI General Embedding (BGE) é um modelo de incorporação de texto que pode mapear qualquer texto para um vetor de incorporação de 1024 dimensões e uma janela de incorporação de 512 tokens. Esses vetores podem ser usados em índices de vetores para LLMs e para tarefas como recuperação, classificação, resposta a perguntas, clustering ou pesquisa semântica. Esse endpoint serve a versão em inglês do modelo e gera embeddings normalizados.
Os modelos de incorporação são especialmente eficazes quando usados em conjunto com LLMs para casos de uso de geração aumentada de recuperação (RAG). O BGE pode ser usado para encontrar trechos de texto relevantes em grandes blocos de documentos que podem ser usados no contexto de um LLM.
Nos aplicativos RAG, o senhor pode melhorar o desempenho do seu sistema de recuperação incluindo um parâmetro de instrução. Os autores do BGE recomendam que se experimente a instrução "Represent this sentence for searching relevant passages:" para a incorporação de consultas, embora seu impacto no desempenho dependa do domínio.