深度思考按各协议的原生参数透传。是否返回思考内容取决于模型:实测 claude-opus-4-8 返回 thinking 块,GPT 系列在 Responses API 中通过 reasoning.effort 控制力度。
控制推理 Token
推理 Token 上限
Anthropic 格式在请求体加 thinking,用 budget_tokens 限制思考用量,max_tokens 需大于 budget_tokens:
json
{
"model": "claude-opus-4-8",
"max_tokens": 3000,
"thinking": { "type": "enabled", "budget_tokens": 2000 },
"messages": [{ "role": "user", "content": "用三步证明根号 2 是无理数" }]
}推理力度
OpenAI Responses API 用 reasoning.effort 指定力度(如 low):
json
{
"model": "gpt-5.6-sol",
"input": "1+1=?",
"reasoning": { "effort": "low" }
}推理消耗的 token 记录在 usage.output_tokens_details.reasoning_tokens 中。
保留推理块
Anthropic 格式开启思考后,响应 content 里先是 type 为 thinking 的块,再是 text 块;usage.output_tokens 包含思考部分。多轮对话回传历史消息时,将 thinking 块原样带回即可。