功能指南

深度思考

各协议用自己的原生参数控制推理:Anthropic 的 thinking.budget_tokens 与 Responses API 的 reasoning.effort,推理消耗单独记录在 usage 里。

深度思考按各协议的原生参数透传。是否返回思考内容取决于模型:实测 claude-opus-4-8 返回 thinking 块,GPT 系列在 Responses API 中通过 reasoning.effort 控制力度。

控制推理 Token

推理 Token 上限

Anthropic 格式在请求体加 thinking,用 budget_tokens 限制思考用量,max_tokens 需大于 budget_tokens

json
{
  "model": "claude-opus-4-8",
  "max_tokens": 3000,
  "thinking": { "type": "enabled", "budget_tokens": 2000 },
  "messages": [{ "role": "user", "content": "用三步证明根号 2 是无理数" }]
}

推理力度

OpenAI Responses API 用 reasoning.effort 指定力度(如 low):

json
{
  "model": "gpt-5.6-sol",
  "input": "1+1=?",
  "reasoning": { "effort": "low" }
}

推理消耗的 token 记录在 usage.output_tokens_details.reasoning_tokens 中。

保留推理块

Anthropic 格式开启思考后,响应 content 里先是 typethinking 的块,再是 text 块;usage.output_tokens 包含思考部分。多轮对话回传历史消息时,将 thinking 块原样带回即可。

50 篇文档。文中出现的模型名与价格以模型广场的实时数据为准。