Pular para o conteúdo principal

Modelos de raciocínio de consulta

Neste artigo, você aprende como escrever solicitações de query para modelos básicos otimizados para tarefas de raciocínio e disponibilizados pelo Unity Gateway.

prompt

Genie Code (modo Agente) pode fazer isso por você. Experimente este prompt de exemplo:

Query the databricks-claude-sonnet-4-5 model using the OpenAI client with extended thinking enabled (budget_tokens set to 10240). Send a reasoning question and print both the thinking summary and the final answer.

A API do Databricks Foundation Model fornece uma API unificada para interagir com todos os modelos do Foundation, incluindo os modelos de raciocínio. O raciocínio confere aos modelos fundamentais capacidades aprimoradas para lidar com tarefas complexas. Alguns modelos também oferecem transparência ao revelar seu processo de raciocínio passo a passo antes de apresentar uma resposta final.

Tipos de modelos de raciocínio​

Existem dois tipos de modelos, apenas para raciocínio e híbridos. A tabela a seguir descreve como modelos diferentes usam abordagens diferentes para controlar o raciocínio:

Modelos

Tipo de modelo de raciocínio

Detalhes

Parâmetros

databricks-claude-haiku-5-5

Raciocínio híbrido

Este modelo é compatível com pensamento adaptativo para um raciocínio mais profundo, e o pensamento pode ser desativado para respostas mais rápidas.

Use os seguintes parâmetros com a Anthropic Messages API:

  • thinking: Defina type como adaptive para usar o raciocínio ou disabled para desativá-lo.
  • output_config.effort: Aceita low, medium ou high. O Databricks define o default como medium quando você omite este parâmetro. Outros valores, incluindo none, xhigh e max, são rejeitados.

databricks-claude-opus-5-5

Apenas raciocínio

Este modelo usa adaptive thinking para cada solicitação e o raciocínio não pode ser desativado.

Use os seguintes parâmetros com a Anthropic Messages API:

  • thinking: Defina type como adaptive. O raciocínio desativado e os valores manuais de budget_tokens são rejeitados.
  • output_config.effort: Aceita low, medium, high, xhigh ou max. O Databricks define o default como medium quando você omite este parâmetro. Outros valores, incluindo none e disabled, são rejeitados.

databricks-claude-fable-5-1

Apenas raciocínio

Este modelo sempre usa raciocínio adaptativo, e o raciocínio não pode ser desativado.

Use os seguintes parâmetros com a Anthropic Messages API:

  • thinking: defina type como adaptive.
  • output_config.effort: Aceita low, medium, high, xhigh ou max. A Databricks não define um default; a Anthropic usa high quando você omite este parâmetro. Outros valores, incluindo none, são rejeitados.

databricks-gpt-6-1-sol

Apenas raciocínio

Este modelo usa raciocínio interno em suas respostas por default.

Use o parâmetro reasoning_effort para controlar a profundidade de raciocínio. Os valores aceitos são none, low, medium, high, xhigh e max. Um maior esforço de raciocínio pode melhorar a precisão em tarefas complexas ao custo de maior latência e uso de tokens.

databricks-gpt-6-sol e databricks-gpt-6-luna

Apenas raciocínio

These models use internal reasoning in their responses by default.

Use o parâmetro reasoning_effort para controlar a profundidade de raciocínio. Os valores aceitos são none, low, medium, high, xhigh e max. O Databricks define o default como medium quando você omite este parâmetro. Um maior esforço de raciocínio pode melhorar a precisão em tarefas complexas ao custo de maior latência e uso de tokens.

databricks-gpt-6-astra

Apenas raciocínio

Este modelo sempre usa raciocínio interno em suas respostas.

Use o parâmetro reasoning_effort para controlar a profundidade do raciocínio. Os valores aceitos são low, medium, high, xhigh e max. O Databricks não define um default. Outros valores, incluindo none e minimal, são rejeitados. Um maior esforço de raciocínio pode melhorar a precisão em tarefas complexas ao custo de maior latência e uso de tokens.

Modelos GPT-5 como databricks-gpt-5-6-sol, databricks-gpt-5-6-terra, databricks-gpt-5-6-luna, databricks-gpt-5-5-pro, databricks-gpt-5-5, databricks-gpt-5-4, databricks-gpt-5-4-mini, databricks-gpt-5-4-nano, databricks-gpt-5-2, databricks-gpt-5-1, databricks-gpt-5, databricks-gpt-5-mini e databricks-gpt-5-nano.

Apenas raciocínio

Esses modelos sempre usam o raciocínio interno em suas respostas.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effortEste parâmetro só é aceito por um conjunto limitado de modelos. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e o uso de tokens.
    • Para GPT-5.5 e GPT-5.5 Pro, o parâmetro reasoning_effort é definido como medium por default, mas pode ser alterado nas solicitações.
    • Para GPT-5.1 e GPT-5.2, o parâmetro reasoning_effort é definido como none por default, mas pode ser alterado nas solicitações.
    • Para GPT-5, GPT-5 mini e GPT-5 nano, o parâmetro reasoning_effort é definido como minimal por default, mas pode ser alterado nas solicitações.

Modelos Claude como databricks-claude-sonnet-4-6, databricks-claude-sonnet-4-5, databricks-claude-opus-5, databricks-claude-opus-4-8, databricks-claude-opus-4-7, databricks-claude-opus-4-6, databricks-claude-opus-4-5 e databricks-claude-opus-4-1.

Raciocínio híbrido

Esses modelos oferecem suporte tanto a respostas rápidas e instantâneas quanto a um raciocínio mais profundo quando necessário.

Inclua os seguintes parâmetros para usar o raciocínio híbrido:

  • thinking
  • budget_tokens: controla quantos tokens o modelo pode utilizar para o pensamento interno. Orçamentos mais elevados podem melhorar a qualidade para tarefas complexas, mas o uso acima de 32K pode variar. budget_tokens deve ser menor que max_tokens.

databricks-gemini-3-8-flash

Raciocínio híbrido

Este modelo oferece suporte a respostas rápidas e instantâneas e a um raciocínio mais profundo quando necessário.

Inclua o seguinte parâmetro para usar o raciocínio híbrido:

  • reasoning_effort: Este parâmetro aceita valores de "low", "medium" (default) ou "high". O Gemini 3.8 Flash não oferece suporte a "minimal".

databricks-gemini-3-7-flash

Raciocínio híbrido

Este modelo oferece suporte a respostas rápidas e instantâneas e a um raciocínio mais profundo quando necessário.

Inclua o seguinte parâmetro para usar o raciocínio híbrido:

  • reasoning_effort: Este parâmetro aceita valores de "low", "medium" (default) ou "high". O Gemini 3.7 Flash não oferece suporte a "minimal".

Modelos Gemini 3 como databricks-gemini-3-6-flash, databricks-gemini-3-5-flash, databricks-gemini-3-5-flash-lite, databricks-gemini-3-1-pro, databricks-gemini-3-1-flash-lite e databricks-gemini-3-flash

Raciocínio híbrido

Esses modelos oferecem suporte tanto a respostas rápidas e instantâneas quanto a um raciocínio mais profundo quando necessário.

Inclua os seguintes parâmetros para usar o raciocínio híbrido:

  • reasoning_effortEste parâmetro é aceito pelos modelos Gemini 3 e superiores.
    • Para modelos Gemini 3, este parâmetro aceita os valores "minimal", "low" (default), "medium" ou "high". Use "minimal" para ignorar o raciocínio para as respostas mais rápidas e com menor latência. Solicitações que usam "minimal" não retornam tokens de raciocínio.

Modelos GPT OSS como databricks-gpt-oss-120b e databricks-gpt-oss-20b.

Apenas raciocínio

Esses modelos sempre usam o raciocínio interno em suas respostas.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effortEste parâmetro só é aceito por um conjunto limitado de modelos. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e o uso de tokens.
    • Para modelos GPT OSS, este parâmetro aceita valores de "low", "medium" (default) ou "high". "minimal" mapeia para "low", e "xhigh" e "max" mapeiam para "high". "none" é tratado como não definido porque os modelos GPT OSS sempre raciocinam.

databricks-grok-4-6

Apenas raciocínio

Este modelo sempre usa raciocínio interno em suas respostas.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effort: este parâmetro aceita valores de "low", "medium", "high" ou "xhigh". Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e a utilização de tokens.

databricks-glm-5-2, databricks-deepseek-v4-1-flash, databricks-deepseek-v4-pro-0813, databricks-deepseek-v4-flash-0731 e databricks-kimi-k3.

Raciocínio híbrido

Esses modelos raciocinam por default e suportam tanto um raciocínio mais profundo quanto respostas rápidas e instantâneas quando reasoning_effort é definido como "none".

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effort: Os valores aceitos variam de acordo com o modelo, e todos esses modelos usam "max" como default quando reasoning_effort é omitido. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e a utilização de tokens.
    • Para o GLM-5.2, este parâmetro aceita valores de "high" ou "max". Outros valores de esforço recorrem a "max".
    • Para o DeepSeek V4.1 Flash, este parâmetro aceita "low", "high", "xhigh" ou "max" (default). "minimal" mapeia para "low", e "medium" mapeia para "high". "none" ou "disabled" desativa o raciocínio. Outros valores são rejeitados.
    • Para o DeepSeek V4 Pro (0813) e o DeepSeek V4 Flash (0731), este parâmetro aceita valores de "low", "high" ou "max". Outros valores de esforço usam "max" como contingência.
    • Para o Kimi K3, este parâmetro aceita valores de "low", "high" ou "max". Outros valores de esforço usam "max" como contingência.

databricks-glm-5-3, databricks-glm-5-3-flash e databricks-inkling.

Apenas raciocínio

Estes modelos sempre usam raciocínio interno em suas respostas, e o raciocínio não pode ser desativado.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effort: Os valores aceitos e os default variam de acordo com o modelo. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e a utilização de tokens.
    • Para o GLM 5.3, este parâmetro aceita "low", "high" ou "max". Se você omitir o parâmetro ou especificar "minimal", "medium" ou "xhigh", o modelo usará "max". O valor "none" é rejeitado porque o raciocínio não pode ser desativado.
    • Para o GLM-5.3-Flash, este parâmetro aceita valores de "low", "high" ou "max" (default). Outros valores de esforço usam "max" como contingência. "none" não é suportado e retorna um erro.
    • Para Inkling, este parâmetro aceita valores de "minimal", "low", "medium", "high" (default), "xhigh" ou "max". "minimal" e "low" mapeiam para o mesmo nível mais baixo, e "xhigh" e "max" mapeiam para o mesmo nível mais alto. "none" mapeia para o menor esforço de raciocínio em vez de desativar o raciocínio.

Modelos

Tipo de modelo de raciocínio

Detalhes

Parâmetros

databricks-claude-haiku-5-5

Raciocínio híbrido

Este modelo é compatível com pensamento adaptativo para um raciocínio mais profundo, e o pensamento pode ser desativado para respostas mais rápidas.

Use os seguintes parâmetros com a Anthropic Messages API:

  • thinking: Defina type como adaptive para usar o raciocínio ou disabled para desativá-lo.
  • output_config.effort: Aceita low, medium ou high. O Databricks define o default como medium quando você omite este parâmetro. Outros valores, incluindo none, xhigh e max, são rejeitados.

databricks-claude-opus-5-5

Apenas raciocínio

Este modelo usa adaptive thinking para cada solicitação e o raciocínio não pode ser desativado.

Use os seguintes parâmetros com a Anthropic Messages API:

  • thinking: Defina type como adaptive. O raciocínio desativado e os valores manuais de budget_tokens são rejeitados.
  • output_config.effort: Aceita low, medium, high, xhigh ou max. O Databricks define o default como medium quando você omite este parâmetro. Outros valores, incluindo none e disabled, são rejeitados.

databricks-claude-fable-5-1

Apenas raciocínio

Este modelo sempre usa raciocínio adaptativo, e o raciocínio não pode ser desativado.

Use os seguintes parâmetros com a Anthropic Messages API:

  • thinking: defina type como adaptive.
  • output_config.effort: Aceita low, medium, high, xhigh ou max. A Databricks não define um default; a Anthropic usa high quando você omite este parâmetro. Outros valores, incluindo none, são rejeitados.

databricks-gpt-6-1-sol

Apenas raciocínio

Este modelo usa raciocínio interno em suas respostas por default.

Use o parâmetro reasoning_effort para controlar a profundidade de raciocínio. Os valores aceitos são none, low, medium, high, xhigh e max. Um maior esforço de raciocínio pode melhorar a precisão em tarefas complexas ao custo de maior latência e uso de tokens.

databricks-gpt-6-sol e databricks-gpt-6-luna

Apenas raciocínio

These models use internal reasoning in their responses by default.

Use o parâmetro reasoning_effort para controlar a profundidade de raciocínio. Os valores aceitos são none, low, medium, high, xhigh e max. O Databricks define o default como medium quando você omite este parâmetro. Um maior esforço de raciocínio pode melhorar a precisão em tarefas complexas ao custo de maior latência e uso de tokens.

databricks-gpt-6-astra

Apenas raciocínio

Este modelo sempre usa raciocínio interno em suas respostas.

Use o parâmetro reasoning_effort para controlar a profundidade do raciocínio. Os valores aceitos são low, medium, high, xhigh e max. O Databricks não define um default. Outros valores, incluindo none e minimal, são rejeitados. Um maior esforço de raciocínio pode melhorar a precisão em tarefas complexas ao custo de maior latência e uso de tokens.

Modelos GPT-5 como databricks-gpt-5-6-sol, databricks-gpt-5-6-terra, databricks-gpt-5-6-luna, databricks-gpt-5-5-pro, databricks-gpt-5-5, databricks-gpt-5-4, databricks-gpt-5-4-mini, databricks-gpt-5-4-nano, databricks-gpt-5-2, databricks-gpt-5-1, databricks-gpt-5, databricks-gpt-5-mini e databricks-gpt-5-nano.

Apenas raciocínio

Esses modelos sempre usam o raciocínio interno em suas respostas.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effortEste parâmetro só é aceito por um conjunto limitado de modelos. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e o uso de tokens.
    • Para GPT-5.5 e GPT-5.5 Pro, o parâmetro reasoning_effort é definido como medium por default, mas pode ser alterado nas solicitações.
    • Para GPT-5.1 e GPT-5.2, o parâmetro reasoning_effort é definido como none por default, mas pode ser alterado nas solicitações.
    • Para GPT-5, GPT-5 mini e GPT-5 nano, o parâmetro reasoning_effort é definido como minimal por default, mas pode ser alterado nas solicitações.

Modelos Claude como databricks-claude-sonnet-4-6, databricks-claude-sonnet-4-5, databricks-claude-opus-5, databricks-claude-opus-4-8, databricks-claude-opus-4-7, databricks-claude-opus-4-6, databricks-claude-opus-4-5 e databricks-claude-opus-4-1.

Raciocínio híbrido

Esses modelos oferecem suporte tanto a respostas rápidas e instantâneas quanto a um raciocínio mais profundo quando necessário.

Inclua os seguintes parâmetros para usar o raciocínio híbrido:

  • thinking
  • budget_tokens: controla quantos tokens o modelo pode utilizar para o pensamento interno. Orçamentos mais elevados podem melhorar a qualidade para tarefas complexas, mas o uso acima de 32K pode variar. budget_tokens deve ser menor que max_tokens.

databricks-gemini-3-8-flash

Raciocínio híbrido

Este modelo oferece suporte a respostas rápidas e instantâneas e a um raciocínio mais profundo quando necessário.

Inclua o seguinte parâmetro para usar o raciocínio híbrido:

  • reasoning_effort: Este parâmetro aceita valores de "low", "medium" (default) ou "high". O Gemini 3.8 Flash não oferece suporte a "minimal".

databricks-gemini-3-7-flash

Raciocínio híbrido

Este modelo oferece suporte a respostas rápidas e instantâneas e a um raciocínio mais profundo quando necessário.

Inclua o seguinte parâmetro para usar o raciocínio híbrido:

  • reasoning_effort: Este parâmetro aceita valores de "low", "medium" (default) ou "high". O Gemini 3.7 Flash não oferece suporte a "minimal".

Modelos Gemini 3 como databricks-gemini-3-6-flash, databricks-gemini-3-5-flash, databricks-gemini-3-5-flash-lite, databricks-gemini-3-1-pro, databricks-gemini-3-1-flash-lite e databricks-gemini-3-flash

Raciocínio híbrido

Esses modelos oferecem suporte tanto a respostas rápidas e instantâneas quanto a um raciocínio mais profundo quando necessário.

Inclua os seguintes parâmetros para usar o raciocínio híbrido:

  • reasoning_effortEste parâmetro é aceito pelos modelos Gemini 3 e superiores.
    • Para modelos Gemini 3, este parâmetro aceita os valores "minimal", "low" (default), "medium" ou "high". Use "minimal" para ignorar o raciocínio para as respostas mais rápidas e com menor latência. Solicitações que usam "minimal" não retornam tokens de raciocínio.

Modelos GPT OSS como databricks-gpt-oss-120b e databricks-gpt-oss-20b.

Apenas raciocínio

Esses modelos sempre usam o raciocínio interno em suas respostas.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effortEste parâmetro só é aceito por um conjunto limitado de modelos. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e o uso de tokens.
    • Para modelos GPT OSS, este parâmetro aceita valores de "low", "medium" (default) ou "high". "minimal" mapeia para "low", e "xhigh" e "max" mapeiam para "high". "none" é tratado como não definido porque os modelos GPT OSS sempre raciocinam.

databricks-grok-4-6

Apenas raciocínio

Este modelo sempre usa raciocínio interno em suas respostas.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effort: este parâmetro aceita valores de "low", "medium", "high" ou "xhigh". Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e a utilização de tokens.

databricks-glm-5-2, databricks-deepseek-v4-1-flash, databricks-deepseek-v4-pro-0813, databricks-deepseek-v4-flash-0731 e databricks-kimi-k3.

Raciocínio híbrido

Esses modelos raciocinam por default e suportam tanto um raciocínio mais profundo quanto respostas rápidas e instantâneas quando reasoning_effort é definido como "none".

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effort: Os valores aceitos variam de acordo com o modelo, e todos esses modelos usam "max" como default quando reasoning_effort é omitido. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e a utilização de tokens.
    • Para o GLM-5.2, este parâmetro aceita valores de "high" ou "max". Outros valores de esforço recorrem a "max".
    • Para o DeepSeek V4.1 Flash, este parâmetro aceita "low", "high", "xhigh" ou "max" (default). "minimal" mapeia para "low", e "medium" mapeia para "high". "none" ou "disabled" desativa o raciocínio. Outros valores são rejeitados.
    • Para o DeepSeek V4 Pro (0813) e o DeepSeek V4 Flash (0731), este parâmetro aceita valores de "low", "high" ou "max". Outros valores de esforço usam "max" como contingência.
    • Para o Kimi K3, este parâmetro aceita valores de "low", "high" ou "max". Outros valores de esforço usam "max" como contingência.

databricks-glm-5-3, databricks-glm-5-3-flash e databricks-inkling.

Apenas raciocínio

Estes modelos sempre usam raciocínio interno em suas respostas, e o raciocínio não pode ser desativado.

Use o seguinte parâmetro em sua solicitação:

  • reasoning_effort: Os valores aceitos e os default variam de acordo com o modelo. Um maior esforço de raciocínio pode resultar em respostas mais ponderadas e precisas, mas pode aumentar a latência e a utilização de tokens.
    • Para o GLM 5.3, este parâmetro aceita "low", "high" ou "max". Se você omitir o parâmetro ou especificar "minimal", "medium" ou "xhigh", o modelo usará "max". O valor "none" é rejeitado porque o raciocínio não pode ser desativado.
    • Para o GLM-5.3-Flash, este parâmetro aceita valores de "low", "high" ou "max" (default). Outros valores de esforço usam "max" como contingência. "none" não é suportado e retorna um erro.
    • Para Inkling, este parâmetro aceita valores de "minimal", "low", "medium", "high" (default), "xhigh" ou "max". "minimal" e "low" mapeiam para o mesmo nível mais baixo, e "xhigh" e "max" mapeiam para o mesmo nível mais alto. "none" mapeia para o menor esforço de raciocínio em vez de desativar o raciocínio.

Exemplos de consultas​

nota

Os exemplos a seguir são baseados no Unity Gateway e em serviços de modelo. Se você usar Endpoint de servindo modelo em vez de serviços de modelo, substitua o nome do serviço de modelo por um nome de Endpoint. Consulte a lista detalhada de modelos suportados pelas APIs do Databricks Foundation Model para ver uma lista de modelos de fundação disponíveis e seus nomes de serviço e endpoint de modelo.

A maioria dos modelos de raciocínio usa o endpoint chat completions. Claude Haiku 5.5, Claude Opus 5.5 e Claude Fable 5.1 usam a Anthropic Messages API, conforme mostrado em seus exemplos.

Python
import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ.get('YOUR_DATABRICKS_TOKEN'),
base_url=os.environ.get('YOUR_DATABRICKS_BASE_URL')
)

response = client.chat.completions.create(
model="system.ai.claude-sonnet-4-5",
messages=[{"role": "user", "content": "Why is the sky blue?"}],
max_tokens=20480,
extra_body={
"thinking": {
"type": "enabled",
"budget_tokens": 10240
}
}
)

msg = response.choices[0].message
reasoning = msg.content[0]["summary"][0]["text"]
answer = msg.content[1]["text"]

print("Reasoning:", reasoning)
print("Answer:", answer)

A resposta da API inclui blocos de conteúdo textual e de reflexão:

Python
ChatCompletionMessage(
role="assistant",
content=[
{
"type": "reasoning",
"summary": [
{
"type": "summary_text",
"text": ("The question is asking about the scientific explanation for why the sky appears blue... "),
"signature": ("EqoBCkgIARABGAIiQAhCWRmlaLuPiHaF357JzGmloqLqkeBm3cHG9NFTxKMyC/9bBdBInUsE3IZk6RxWge...")
}
]
},
{
"type": "text",
"text": (
"# Why the Sky Is Blue\n\n"
"The sky appears blue because of a phenomenon called Rayleigh scattering. Here's how it works..."
)
}
],
refusal=None,
annotations=None,
audio=None,
function_call=None,
tool_calls=None
)

gerenciar o raciocínio em várias etapas​

Esta seção é específica para o modelo databricks-claude-sonnet-4-5 .

Em conversas com várias voltas, apenas os blocos de raciocínio associados à última volta do assistente ou sessão de uso da ferramenta são visíveis para o modelo e contados como tokens de entrada.

Se não desejar passar tokens de raciocínio de volta para o modelo (por exemplo, se não precisar dele para raciocinar sobre as etapas anteriores), é possível omitir o bloco de raciocínio completamente. Por exemplo:

Python
response = client.chat.completions.create(
model="system.ai.claude-sonnet-4-5",
messages=[
{"role": "user", "content": "Why is the sky blue?"},
{"role": "assistant", "content": text_content},
{"role": "user", "content": "Can you explain in a way that a 5-year-old child can understand?"}
],
max_tokens=20480,
extra_body={
"thinking": {
"type": "enabled",
"budget_tokens": 10240
}
}
)

answer = response.choices[0].message.content[1]["text"]
print("Answer:", answer)

No entanto, se você precisar que o modelo raciocine sobre seu processo de raciocínio anterior - por exemplo, se estiver criando experiências que revelem seu raciocínio intermediário - você deve incluir a mensagem completa e não modificada do assistente, incluindo o bloco de raciocínio do turno anterior. Veja como continuar um tópico com a mensagem completa do assistente:

Python
assistant_message = response.choices[0].message

response = client.chat.completions.create(
model="system.ai.claude-sonnet-4-5",
messages=[
{"role": "user", "content": "Why is the sky blue?"},
{"role": "assistant", "content": text_content},
{"role": "user", "content": "Can you explain in a way that a 5-year-old child can understand?"},
assistant_message,
{"role": "user", "content": "Can you simplify the previous answer?"}
],
max_tokens=20480,
extra_body={
"thinking": {
"type": "enabled",
"budget_tokens": 10240
}
}
)

answer = response.choices[0].message.content[1]["text"]
print("Answer:", answer)

API de Respostas Abertas​

Ao usar a Open Responses API, o raciocínio é retornado como reasoning itens na resposta output. Para permitir que o modelo raciocine sobre seu pensamento anterior em uma volta posterior, inclua esses reasoning itens—com seu campo encrypted_content inalterado—na próxima solicitação input.

Um item reasoning retornado na saída da resposta tem o seguinte formato:

JSON
{
"type": "reasoning",
"id": "rs_abc123",
"content": [{ "type": "reasoning_text", "text": "Let me work through the question..." }],
"encrypted_content": "<opaque-provider-signature>"
}

Para continuar a conversa, envie a saída do turno anterior de volta em input, com o item reasoning preservado literalmente:

JSON
{
"model": "databricks-claude-sonnet-4-5",
"input": [
{ "role": "user", "content": "Why is the sky blue?" },
{
"type": "reasoning",
"id": "rs_abc123",
"content": [{ "type": "reasoning_text", "text": "Let me work through the question..." }],
"encrypted_content": "<opaque-provider-signature>"
},
{ "role": "assistant", "content": "The sky is blue because of Rayleigh scattering..." },
{ "role": "user", "content": "Can you explain it for a five-year-old?" }
]
}

O valor encrypted_content contém o estado de raciocínio específico do provedor. Se for descartado ou modificado, o modelo não poderá raciocinar sobre seu pensamento anterior. Isso se aplica aos modelos Anthropic Claude e Google Gemini.

Como funciona um modelo de raciocínio?​

Os modelos de raciocínio introduzem tokens de raciocínio especiais, além dos tokens de entrada e saída padrão. Esses tokens permitem que o modelo "reflita sobre o prompt", decompondo-o e considerando diferentes maneiras de responder. Após esse processo de raciocínio interno, o modelo gera sua resposta final como tokens de saída visíveis. Alguns modelos, como o databricks-claude-sonnet-4-5, exibem esses tokens de raciocínio aos usuários, enquanto outros, como a série OpenAI o, os descartam e não os expõem na saída final.

Recurso adicional​