メインコンテンツまでスキップ

推論モデルのクエリ

この記事では、推論タスクに最適化され、Unity Gateway によって提供される基盤モデル向けのクエリーリクエストの記述方法を学びます。

プロンプト

Genie Code(エージェントモード)がこれを実行できます。このプロンプトの例を試してください。

Query the databricks-claude-sonnet-4-5 model using the OpenAI client with extended thinking enabled (budget_tokens set to 10240). Send a reasoning question and print both the thinking summary and the final answer.

Databricks基盤モデルAPI 、推論モデルを含むすべての基盤モデルと対話するための統合APIを提供します。 推論機能により、基盤モデルは複雑なタスクに取り組むための強化された能力を備える。一部のモデルは、最終的な回答を出す前に、段階的な思考プロセスを明らかにすることで透明性を確保している。

推論モデルの種類​

モデルには、推論のみとハイブリッドの 2 種類があります。次の表は、異なるモデルが推論を制御するために異なるアプローチを使用する方法を示しています。

モデル

推論モデルの種類

詳細

パラメータ

databricks-claude-haiku-5-5

ハイブリッド推論

このモデルは、より深い推論のための適応的思考をサポートしており、より迅速な応答のために思考を無効にすることができます。

Anthropic Messages APIで以下のパラメーターを使用します:

  • thinking:推論を使用するには type を adaptive に設定し、無効にするには disabled に設定します。
  • output_config.effort: low、medium、または high を受け入れます。このパラメーターを省略した場合、Databricks では default で medium に設定されます。none、xhigh、max を含むその他の値は拒否されます。

databricks-claude-opus-5-5

推論のみ

このモデルはすべてのリクエストに適応型思考を使用するため、推論を無効にすることはできません。

Anthropic Messages APIで以下のパラメーターを使用します:

  • thinking:type を adaptive に設定します。無効化された思考と手動の budget_tokens 値は拒否されます。
  • output_config.effort:low、medium、high、xhigh、または max を受け入れます。このパラメーターを省略した場合、Databricks は default を medium に設定します。none や disabled を含むその他の値は拒否されます。

databricks-claude-fable-5-1

推論のみ

このモデルは常にアダプティブシンキングを使用しており、推論を無効にすることはできません。

Anthropic Messages APIで以下のパラメーターを使用します:

  • thinking:type を adaptive に設定します。
  • output_config.effort:low、medium、high、xhigh、または max を受け入れます。Databricksはdefaultを設定しません。このパラメーターを省略した場合、Anthropicは high を使用します。none を含むその他の値は拒否されます。

databricks-gpt-6-1-sol

推論のみ

このモデルは、defaultで応答に内部推論を使用します。

reasoning_effort パラメーターを使用して推論の深度を制御します。指定できる値は、none、low、medium、high、xhigh、およびmaxです。推論の努力を高めると、複雑なタスクの精度が向上しますが、レイテンシとトークンの使用量が増加する可能性があります。

databricks-gpt-6-sol そして databricks-gpt-6-luna

推論のみ

These models use internal reasoning in their responses by default.

推論の深さを制御するには reasoning_effort パラメーターを使用します。指定できる値は、none、low、medium、high、xhigh、およびmaxです。このパラメーターを省略した場合、Databricks ではdefaultで medium が設定されます。推論の努力度を高めると、複雑なタスクでの精度を向上させることができますが、レイテンシーとトークン使用量が増加するというデメリットがあります。

databricks-gpt-6-astra

推論のみ

このモデルは、応答において常に内部推論を使用します。

推論の深さを制御するには、reasoning_effort パラメーターを使用します。指定できる値は、low、medium、high、xhigh、およびmaxです。Databricks は default を設定しません。none や minimal を含むその他の値は拒否されます。推論の努力を高めると、複雑なタスクの精度が向上する可能性がありますが、レイテンシとトークン使用量が増加します。

databricks-gpt-5-6-sol、databricks-gpt-5-6-terra、databricks-gpt-5-6-luna、databricks-gpt-5-5-pro、databricks-gpt-5-5、databricks-gpt-5-4、databricks-gpt-5-4-mini、databricks-gpt-5-4-nano、databricks-gpt-5-2、databricks-gpt-5-1、databricks-gpt-5、databricks-gpt-5-mini、およびdatabricks-gpt-5-nanoなどのGPT-5モデル。

推論のみ

これらのモデルは、応答に常に内部推論を使用します。

リクエストで次のパラメーターを使用します。

  • reasoning_effort: このパラメーターは、限られたモデルでのみ受け入れられます。 推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、待ち時間とトークンの使用量が増える可能性があります。
    • GPT-5.5 および GPT-5.5 Pro の場合、 reasoning_effort問題は確実にmediumに設定されますが、リクエストでオーバーライドできます。
    • GPT-5.1 および GPT-5.2 の場合、 reasoning_effort問題は確実にnoneに設定されますが、リクエストでオーバーライドできます。
    • GPT-5、GPT-5 mini、および GPT-5 nano の場合、 reasoning_effort問題は当然によりminimalに設定されますが、リクエストでオーバーライドできます。

databricks-claude-sonnet-4-6、databricks-claude-sonnet-4-5、databricks-claude-opus-5、databricks-claude-opus-4-8、databricks-claude-opus-4-7、databricks-claude-opus-4-6、databricks-claude-opus-4-5、databricks-claude-opus-4-1といったClaudeモデルです。

ハイブリッド推論

これらのモデルは、必要に応じて、高速で即時の返信とより深い推論の両方をサポートします。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • thinking
  • budget_tokens: モデルが内部思考に使用できるトークンの数を制御します。予算を高くすると、複雑なタスクの品質が向上しますが、32K を超える使用量は異なる場合があります。budget_tokens は max_tokens未満でなければなりません。

databricks-gemini-3-8-flash

ハイブリッド推論

このモデルは、素早いインスタント返信と、必要に応じたより深い推論の両方をサポートしています。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • reasoning_effort:このパラメーターは、 "low" 、 "medium" (default)、または "high" の値を受け入れます。Gemini 3.8 Flash は "minimal" をサポートしていません。

databricks-gemini-3-7-flash

ハイブリッド推論

このモデルは、素早いインスタント返信と、必要に応じたより深い推論の両方をサポートしています。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • reasoning_effort:このパラメーターは、 "low" 、 "medium" (default)、または "high" の値を受け入れます。Gemini 3.7 Flash は "minimal" をサポートしていません。

databricks-gemini-3-6-flash、databricks-gemini-3-5-flash、databricks-gemini-3-5-flash-lite、databricks-gemini-3-1-pro、databricks-gemini-3-1-flash-liteなどのGemini 3モデル databricks-gemini-3-flash

ハイブリッド推論

これらのモデルは、必要に応じて、高速で即時の返信とより深い推論の両方をサポートします。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • reasoning_effort: この問題は、Gemini 3 以降のモデルで受け入れられます。
    • Gemini 3 モデルの場合、このパラメーターは "minimal"、"low" (default)、"medium"、または"high" の値を受け入れます。"minimal"を使用すると、推論をスキップして最速でレイテンシーが最も低い応答が得られます。"minimal"を使用するリクエストは、推論トークンを返しません。

databricks-gpt-oss-120bやdatabricks-gpt-oss-20bなどのGPT OSSモデル。

推論のみ

これらのモデルは、応答に常に内部推論を使用します。

リクエストで次のパラメーターを使用します。

  • reasoning_effort: このパラメーターは、限られたモデルでのみ受け入れられます。 推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、待ち時間とトークンの使用量が増える可能性があります。
    • GPT OSS モデルの場合、このパラメーターは "low"、"medium" (default)、または "high" の値を受け入れます。"minimal" は "low" にマップされ、"xhigh" および "max" は "high" にマップされます。GPT OSS モデルは常に推論を行うため、"none" は未設定として扱われます。

databricks-grok-4-6

推論のみ

このモデルは、応答において常に内部推論を使用します。

リクエストで次のパラメーターを使用します。

  • reasoning_effort:このパラメーターは、"low"、"medium"、"high"、または"xhigh"の値を受け入れます。推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、レイテンシーとトークンの使用量が増える可能性があります。

databricks-glm-5-2、databricks-deepseek-v4-1-flash、databricks-deepseek-v4-pro-0813、databricks-deepseek-v4-flash-0731、およびdatabricks-kimi-k3。

ハイブリッド推論

これらのモデルはdefaultで推論を行い、reasoning_effortが"none"に設定されている場合は、より深い推論と高速なインスタント応答の両方をサポートします。

リクエストで次のパラメーターを使用します。

  • reasoning_effort:受け入れ可能な値はモデルによって異なり、reasoning_effortが省略された場合、これらのモデルはすべてdefaultで"max"になります。推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、レイテンシーとトークンの使用量が増える可能性があります。
    • GLM-5.2 の場合、このパラメーターは "high" または "max" の値を受け入れます。その他のエフォート値は"max"にフォールバックします。
    • For DeepSeek V4.1 Flash, this パラメーター accepts "low", "high", "xhigh", or "max" (default)."minimal" は "low" にマップされ、"medium" は "high" にマップされます。"none" または "disabled" は推論を無効にします。その他の値は拒否されます。
    • DeepSeek V4 Pro (0813) および DeepSeek V4 Flash (0731) の場合、このパラメーターは "low"、 "high"、または "max" の値を受け入れます。その他のエフォート値は "max" にフォールバックします。
    • Kimi K3 の場合、このパラメーターは "low"、 "high"、または "max" の値を受け入れます。その他のエフォート値は "max" にフォールバックします。

databricks-glm-5-3、databricks-glm-5-3-flash、databricks-inkling。

推論のみ

これらのモデルは応答に常に内部推論を使用しており、推論を無効にすることはできません。

リクエストで次のパラメーターを使用します。

  • reasoning_effort:受け入れ可能な値とdefaultは、モデルによって異なります。推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、レイテンシーとトークンの使用量が増える可能性があります。
    • GLM 5.3 の場合、このパラメーターは "low"、"high"、または"max"を受け入れます。パラメーターを省略するか、"minimal"、"medium"、または"xhigh"を指定した場合、モデルは "max" を使用します。"none" 値は、推論を無効にできないため拒否されます。
    • GLM-5.3-Flash の場合、このパラメーターは "low"、"high"、または"max" (default) の値を受け入れます。その他のエフォート値は"max"にフォールバックします。"none"はサポートされておらず、エラーを返します。
    • Inkling の場合、このパラメーターは "minimal"、"low"、"medium"、"high" (default)、"xhigh"、または"max"の値を受け入れます。"minimal" と "low" は同じ最下位層にマップされ、"xhigh" と "max" は同じ最上位層にマップされます。"none" は、推論を無効にするのではなく、最も低い推論努力にマップされます。

モデル

推論モデルの種類

詳細

パラメータ

databricks-claude-haiku-5-5

ハイブリッド推論

このモデルは、より深い推論のための適応的思考をサポートしており、より迅速な応答のために思考を無効にすることができます。

Anthropic Messages APIで以下のパラメーターを使用します:

  • thinking:推論を使用するには type を adaptive に設定し、無効にするには disabled に設定します。
  • output_config.effort: low、medium、または high を受け入れます。このパラメーターを省略した場合、Databricks では default で medium に設定されます。none、xhigh、max を含むその他の値は拒否されます。

databricks-claude-opus-5-5

推論のみ

このモデルはすべてのリクエストに適応型思考を使用するため、推論を無効にすることはできません。

Anthropic Messages APIで以下のパラメーターを使用します:

  • thinking:type を adaptive に設定します。無効化された思考と手動の budget_tokens 値は拒否されます。
  • output_config.effort:low、medium、high、xhigh、または max を受け入れます。このパラメーターを省略した場合、Databricks は default を medium に設定します。none や disabled を含むその他の値は拒否されます。

databricks-claude-fable-5-1

推論のみ

このモデルは常にアダプティブシンキングを使用しており、推論を無効にすることはできません。

Anthropic Messages APIで以下のパラメーターを使用します:

  • thinking:type を adaptive に設定します。
  • output_config.effort:low、medium、high、xhigh、または max を受け入れます。Databricksはdefaultを設定しません。このパラメーターを省略した場合、Anthropicは high を使用します。none を含むその他の値は拒否されます。

databricks-gpt-6-1-sol

推論のみ

このモデルは、defaultで応答に内部推論を使用します。

reasoning_effort パラメーターを使用して推論の深度を制御します。指定できる値は、none、low、medium、high、xhigh、およびmaxです。推論の努力を高めると、複雑なタスクの精度が向上しますが、レイテンシとトークンの使用量が増加する可能性があります。

databricks-gpt-6-sol そして databricks-gpt-6-luna

推論のみ

These models use internal reasoning in their responses by default.

推論の深さを制御するには reasoning_effort パラメーターを使用します。指定できる値は、none、low、medium、high、xhigh、およびmaxです。このパラメーターを省略した場合、Databricks ではdefaultで medium が設定されます。推論の努力度を高めると、複雑なタスクでの精度を向上させることができますが、レイテンシーとトークン使用量が増加するというデメリットがあります。

databricks-gpt-6-astra

推論のみ

このモデルは、応答において常に内部推論を使用します。

推論の深さを制御するには、reasoning_effort パラメーターを使用します。指定できる値は、low、medium、high、xhigh、およびmaxです。Databricks は default を設定しません。none や minimal を含むその他の値は拒否されます。推論の努力を高めると、複雑なタスクの精度が向上する可能性がありますが、レイテンシとトークン使用量が増加します。

databricks-gpt-5-6-sol、databricks-gpt-5-6-terra、databricks-gpt-5-6-luna、databricks-gpt-5-5-pro、databricks-gpt-5-5、databricks-gpt-5-4、databricks-gpt-5-4-mini、databricks-gpt-5-4-nano、databricks-gpt-5-2、databricks-gpt-5-1、databricks-gpt-5、databricks-gpt-5-mini、およびdatabricks-gpt-5-nanoなどのGPT-5モデル。

推論のみ

これらのモデルは、応答に常に内部推論を使用します。

リクエストで次のパラメーターを使用します。

  • reasoning_effort: このパラメーターは、限られたモデルでのみ受け入れられます。 推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、待ち時間とトークンの使用量が増える可能性があります。
    • GPT-5.5 および GPT-5.5 Pro の場合、 reasoning_effort問題は確実にmediumに設定されますが、リクエストでオーバーライドできます。
    • GPT-5.1 および GPT-5.2 の場合、 reasoning_effort問題は確実にnoneに設定されますが、リクエストでオーバーライドできます。
    • GPT-5、GPT-5 mini、および GPT-5 nano の場合、 reasoning_effort問題は当然によりminimalに設定されますが、リクエストでオーバーライドできます。

databricks-claude-sonnet-4-6、databricks-claude-sonnet-4-5、databricks-claude-opus-5、databricks-claude-opus-4-8、databricks-claude-opus-4-7、databricks-claude-opus-4-6、databricks-claude-opus-4-5、databricks-claude-opus-4-1といったClaudeモデルです。

ハイブリッド推論

これらのモデルは、必要に応じて、高速で即時の返信とより深い推論の両方をサポートします。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • thinking
  • budget_tokens: モデルが内部思考に使用できるトークンの数を制御します。予算を高くすると、複雑なタスクの品質が向上しますが、32K を超える使用量は異なる場合があります。budget_tokens は max_tokens未満でなければなりません。

databricks-gemini-3-8-flash

ハイブリッド推論

このモデルは、素早いインスタント返信と、必要に応じたより深い推論の両方をサポートしています。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • reasoning_effort:このパラメーターは、 "low" 、 "medium" (default)、または "high" の値を受け入れます。Gemini 3.8 Flash は "minimal" をサポートしていません。

databricks-gemini-3-7-flash

ハイブリッド推論

このモデルは、素早いインスタント返信と、必要に応じたより深い推論の両方をサポートしています。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • reasoning_effort:このパラメーターは、 "low" 、 "medium" (default)、または "high" の値を受け入れます。Gemini 3.7 Flash は "minimal" をサポートしていません。

databricks-gemini-3-6-flash、databricks-gemini-3-5-flash、databricks-gemini-3-5-flash-lite、databricks-gemini-3-1-pro、databricks-gemini-3-1-flash-liteなどのGemini 3モデル databricks-gemini-3-flash

ハイブリッド推論

これらのモデルは、必要に応じて、高速で即時の返信とより深い推論の両方をサポートします。

ハイブリッド推論を使用するには、次のパラメーターを含めます。

  • reasoning_effort: この問題は、Gemini 3 以降のモデルで受け入れられます。
    • Gemini 3 モデルの場合、このパラメーターは "minimal"、"low" (default)、"medium"、または"high" の値を受け入れます。"minimal"を使用すると、推論をスキップして最速でレイテンシーが最も低い応答が得られます。"minimal"を使用するリクエストは、推論トークンを返しません。

databricks-gpt-oss-120bやdatabricks-gpt-oss-20bなどのGPT OSSモデル。

推論のみ

これらのモデルは、応答に常に内部推論を使用します。

リクエストで次のパラメーターを使用します。

  • reasoning_effort: このパラメーターは、限られたモデルでのみ受け入れられます。 推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、待ち時間とトークンの使用量が増える可能性があります。
    • GPT OSS モデルの場合、このパラメーターは "low"、"medium" (default)、または "high" の値を受け入れます。"minimal" は "low" にマップされ、"xhigh" および "max" は "high" にマップされます。GPT OSS モデルは常に推論を行うため、"none" は未設定として扱われます。

databricks-grok-4-6

推論のみ

このモデルは、応答において常に内部推論を使用します。

リクエストで次のパラメーターを使用します。

  • reasoning_effort:このパラメーターは、"low"、"medium"、"high"、または"xhigh"の値を受け入れます。推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、レイテンシーとトークンの使用量が増える可能性があります。

databricks-glm-5-2、databricks-deepseek-v4-1-flash、databricks-deepseek-v4-pro-0813、databricks-deepseek-v4-flash-0731、およびdatabricks-kimi-k3。

ハイブリッド推論

これらのモデルはdefaultで推論を行い、reasoning_effortが"none"に設定されている場合は、より深い推論と高速なインスタント応答の両方をサポートします。

リクエストで次のパラメーターを使用します。

  • reasoning_effort:受け入れ可能な値はモデルによって異なり、reasoning_effortが省略された場合、これらのモデルはすべてdefaultで"max"になります。推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、レイテンシーとトークンの使用量が増える可能性があります。
    • GLM-5.2 の場合、このパラメーターは "high" または "max" の値を受け入れます。その他のエフォート値は"max"にフォールバックします。
    • For DeepSeek V4.1 Flash, this パラメーター accepts "low", "high", "xhigh", or "max" (default)."minimal" は "low" にマップされ、"medium" は "high" にマップされます。"none" または "disabled" は推論を無効にします。その他の値は拒否されます。
    • DeepSeek V4 Pro (0813) および DeepSeek V4 Flash (0731) の場合、このパラメーターは "low"、 "high"、または "max" の値を受け入れます。その他のエフォート値は "max" にフォールバックします。
    • Kimi K3 の場合、このパラメーターは "low"、 "high"、または "max" の値を受け入れます。その他のエフォート値は "max" にフォールバックします。

databricks-glm-5-3、databricks-glm-5-3-flash、databricks-inkling。

推論のみ

これらのモデルは応答に常に内部推論を使用しており、推論を無効にすることはできません。

リクエストで次のパラメーターを使用します。

  • reasoning_effort:受け入れ可能な値とdefaultは、モデルによって異なります。推論の努力を高めると、より思慮深く正確な応答が得られる可能性がありますが、レイテンシーとトークンの使用量が増える可能性があります。
    • GLM 5.3 の場合、このパラメーターは "low"、"high"、または"max"を受け入れます。パラメーターを省略するか、"minimal"、"medium"、または"xhigh"を指定した場合、モデルは "max" を使用します。"none" 値は、推論を無効にできないため拒否されます。
    • GLM-5.3-Flash の場合、このパラメーターは "low"、"high"、または"max" (default) の値を受け入れます。その他のエフォート値は"max"にフォールバックします。"none"はサポートされておらず、エラーを返します。
    • Inkling の場合、このパラメーターは "minimal"、"low"、"medium"、"high" (default)、"xhigh"、または"max"の値を受け入れます。"minimal" と "low" は同じ最下位層にマップされ、"xhigh" と "max" は同じ最上位層にマップされます。"none" は、推論を無効にするのではなく、最も低い推論努力にマップされます。

クエリの例​

注記

以下の例は、Unity Gatewayとモデルサービスに基づいています。モデルサービング Endpoint ではなくモデル サービスを使用する場合は、モデル サービス名を Endpoint 名に置き換えます。利用可能な基盤モデル、そのモデルサービス、およびEndpoint名のリストについては、Databricks 基盤モデルAPIsがサポートするモデルの詳細リストを参照してください。

ほとんどの推論モデルでは、チャットコンプリーション Endpointが使用されます。例に示されているように、Claude Haiku 5.5、Claude Opus 5.5、および Claude Fable 5.1 は Anthropic Messages API を使用します。

Python
import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ.get('YOUR_DATABRICKS_TOKEN'),
base_url=os.environ.get('YOUR_DATABRICKS_BASE_URL')
)

response = client.chat.completions.create(
model="system.ai.claude-sonnet-4-5",
messages=[{"role": "user", "content": "Why is the sky blue?"}],
max_tokens=20480,
extra_body={
"thinking": {
"type": "enabled",
"budget_tokens": 10240
}
}
)

msg = response.choices[0].message
reasoning = msg.content[0]["summary"][0]["text"]
answer = msg.content[1]["text"]

print("Reasoning:", reasoning)
print("Answer:", answer)

API レスポンスには、思考コンテンツブロックとテキストコンテンツブロックの両方が含まれます。

Python
ChatCompletionMessage(
role="assistant",
content=[
{
"type": "reasoning",
"summary": [
{
"type": "summary_text",
"text": ("The question is asking about the scientific explanation for why the sky appears blue... "),
"signature": ("EqoBCkgIARABGAIiQAhCWRmlaLuPiHaF357JzGmloqLqkeBm3cHG9NFTxKMyC/9bBdBInUsE3IZk6RxWge...")
}
]
},
{
"type": "text",
"text": (
"# Why the Sky Is Blue\n\n"
"The sky appears blue because of a phenomenon called Rayleigh scattering. Here's how it works..."
)
}
],
refusal=None,
annotations=None,
audio=None,
function_call=None,
tool_calls=None
)

複数のターンにわたる推論の管理​

このセクションはdatabricks-claude-sonnet-4-5モデルに特化したものです。

マルチターンの会話では、最後のアシスタントターンまたはツール使用セッションに関連付けられた推論ブロックのみがモデルに表示され、入力トークンとしてカウントされます。

推論トークンをモデルに戻さない場合 (たとえば、前の手順で推論する必要がない場合) は、推論ブロックを完全に省略できます。例えば:

Python
response = client.chat.completions.create(
model="system.ai.claude-sonnet-4-5",
messages=[
{"role": "user", "content": "Why is the sky blue?"},
{"role": "assistant", "content": text_content},
{"role": "user", "content": "Can you explain in a way that a 5-year-old child can understand?"}
],
max_tokens=20480,
extra_body={
"thinking": {
"type": "enabled",
"budget_tokens": 10240
}
}
)

answer = response.choices[0].message.content[1]["text"]
print("Answer:", answer)

ただし、モデルが前の推論プロセスを推論する必要がある場合 (たとえば、中間推論を表示するエクスペリエンスを構築している場合) は、前のターンの推論ブロックを含む、変更されていない完全なアシスタント メッセージを含める必要があります。完全なアシスタントメッセージでスレッドを続ける方法は次のとおりです。

Python
assistant_message = response.choices[0].message

response = client.chat.completions.create(
model="system.ai.claude-sonnet-4-5",
messages=[
{"role": "user", "content": "Why is the sky blue?"},
{"role": "assistant", "content": text_content},
{"role": "user", "content": "Can you explain in a way that a 5-year-old child can understand?"},
assistant_message,
{"role": "user", "content": "Can you simplify the previous answer?"}
],
max_tokens=20480,
extra_body={
"thinking": {
"type": "enabled",
"budget_tokens": 10240
}
}
)

answer = response.choices[0].message.content[1]["text"]
print("Answer:", answer)

Open Responses API​

Open Responses APIを使用する場合、推論は応答outputでreasoning項目として返されます。後のターンでモデルが以前の思考について推論できるようにするには、reasoning項目を(encrypted_contentフィールドは未変更のまま)次のリクエストのinputに含めます。

レスポンス出力で返されるreasoning項目は、次の形式になります。

JSON
{
"type": "reasoning",
"id": "rs_abc123",
"content": [{ "type": "reasoning_text", "text": "Let me work through the question..." }],
"encrypted_content": "<opaque-provider-signature>"
}

会話を続けるには、前のターンの出力をinputで送り返し、reasoningの項目をそのまま保持します。

JSON
{
"model": "databricks-claude-sonnet-4-5",
"input": [
{ "role": "user", "content": "Why is the sky blue?" },
{
"type": "reasoning",
"id": "rs_abc123",
"content": [{ "type": "reasoning_text", "text": "Let me work through the question..." }],
"encrypted_content": "<opaque-provider-signature>"
},
{ "role": "assistant", "content": "The sky is blue because of Rayleigh scattering..." },
{ "role": "user", "content": "Can you explain it for a five-year-old?" }
]
}

encrypted_contentの値はプロバイダー固有の推論状態を含んでいます。削除または変更された場合、モデルは以前の思考について推論できません。これはAnthropic ClaudeおよびGoogle Geminiモデルに適用されます。

推論モデルはどのように機能しますか?​

推論モデルでは、標準の入力トークンと出力トークンに加えて、特別な推論トークンが導入されます。これらのトークンにより、モデルはプロンプトを通じて「考え」、プロンプトを分解し、さまざまな応答方法を検討できます。この内部推論プロセスの後、モデルは最終的な回答を目に見える出力トークンとして生成します。databricks-claude-sonnet-4-5のような一部のモデルは、これらの推論トークンをユーザーに表示する一方で、OpenAI o シリーズなどの他のモデルはそれらを破棄し、最終出力で公開しません。

追加のリソース​