GPT-5.5 应优先使用 Responses API,并从 medium reasoning effort 开始;多轮工具 Agent 要保留响应状态和工具调用之间的推理项,避免上下文断裂。
适合的任务:代码 Agent、复杂数据分析、研究、需要连续工具调用的多轮工作流。
不适合的任务:无需规划的简单检索或分类;应先评估 low,并在延迟极敏感时评估 none。
适用的模型版本:GPT-5.5;页面同时描述其他推理模型,表格和默认值应以 GPT-5.5 模型页为准。
适用的客户端、Agent 或 API:OpenAI Responses API、Python SDK;Chat Completions 仍可用但官方更推荐 Responses。
推荐的推理档位和参数:reasoning={"effort":"medium"} 起步;复杂调试和深度计划比较 high;不要因为任务复杂就无条件使用最高档位。为 reasoning token 和可见输出预留足够 max_output_tokens。
基础调用模板(官方示例按 GPT-5.5 的 medium 配置改写):
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.5",
reasoning={"effort": "medium"},
input=[{
"role": "user",
"content": "Inspect this repository, identify the likely bug, and return evidence plus a safe patch plan.",
}],
)
print(response.output_text)连续两轮调用的最小状态模板:
first = client.responses.create(
model="gpt-5.5",
reasoning={"effort": "medium"},
input="Inspect this repository and identify the likely bug.",
)
second = client.responses.create(
model="gpt-5.5",
previous_response_id=first.id,
input="Now patch the bug and explain the change.",
reasoning={"effort": "medium"},
)
print(second.output_text)在模型页确认 GPT-5.5 的上下文、最大输出和支持的 effort;不要把其他 GPT-5 版本参数直接复制过来。
用 Responses API 发送任务,以 medium 作为基线,并记录响应中的 usage.output_tokens_details.reasoning_tokens、总 token、延迟和是否 incomplete。
有工具调用时,把上一次响应的 reasoning items、function call items 和 function call output items 一起传回;使用 previous_response_id 时由 API 保存状态。
若使用 store=false 或无存储模式,保留每个输出 item(包括加密 reasoning 内容)并完整回放,再追加下一条用户消息。
检查响应状态;若因 max_output_tokens incomplete,增大上限或缩短输入,不能把没有可见答案当成成功。
官方将 GPT-5.5 的默认 reasoning effort 标为 medium,并说明可用档位依模型而异。
官方建议开始实验时至少为 reasoning 和可见输出预留 25,000 个 token;实际占用可从数百到数万,需以响应 usage 为准。
官方多轮函数调用建议传回上次函数调用后的 reasoning items、函数调用项和工具输出项。
reasoning token 不在可见答案中,但占用上下文并按 output token 计费;max_output_tokens 同时限制 reasoning、可见输出和格式 token。
本文只保存官方 API 配置规则,不代表某个业务任务的质量提升;应在代表性 eval 上比较 effort。
“保留 reasoning items”是状态连续性要求,不等于暴露模型原始思维;API 返回的 reasoning 内容仍不可直接读取。
页面也包含其他新模型族的参数说明;GPT-5.5 的 effort、上下文窗口、价格和 snapshot 必须以 GPT-5.5 模型页为准。
25,000 token 是官方起始建议,不是所有请求必须消耗的固定额度;仍需按成本和延迟预算调整。
官方建议 “Reasoning models work better with the Responses API”,并指出 reasoning token “still occupy space in the model’s context window”。
GPT-5.5