GPT-5.6 这次发布,OpenAI 给开发者最大的感受是:做智能体的成本逻辑变了。官方说得很直白,这个新模型家族把前沿级别的智能体能力做到了”便宜得明显”,同时性能边界又往前推了一步。简单讲,以前只有旗舰模型能干的活,现在用更小的模型、更低的推理档位就能拿下,省下来的钱不是一点半点。

开箱体验:低推理档位反而更出彩
从 GPT-5 开始,OpenAI 每一代模型都在朝着”用更少的 token 干更长远的任务”这个方向走,GPT-5.6 延续了这条路线:智能体性能更强、成本更低,而且对底层 harness 几乎不用改。
有个数据很能说明问题:在 Agents’ Last Exam 这个基准上,GPT-5.6 Sol 用 low(低)推理档位,跑赢了 GPT-5.5 用 high(高)推理档位的成绩。换句话说,很多以前需要拉满推理档位的场景,现在降一档甚至两档就够了。
AI 研究公司 Hex 的反馈也印证了这点:把 GPT-5.6 接进他们的 harness 后,低推理档位直接给出了最好结果,”它知道数据什么时候不在那里,不会去追错误线索,用更少的 token 就找到了正确答案”。
模型选择:Luna、Terra 能平替旗舰
过去升级旗舰模型、开最高推理档位,基本是长任务场景的唯一选择,因为便宜模型处理长上下文和工具调用确实吃力。但 5.6 系列改变了这个局面:投入更多测试时计算后,Luna 和 Terra 的表现常常能对齐 GPT-5.4、5.5,价格却便宜一大截。
文档处理公司 Hypha 的实测很有参考价值:Luna 保持了 GPT-5.5 约 98% 的信息抽取准确率,成本只有后者的十八分之一。这个性价比让他们的智能体把高质量文档理解推广到了更多工作流里。
再看一个更直观的对比。在 BrowseComp(考验模型搜索冷门事实能力的基准)上,三个月前 GPT-5.5(Extra High)得分 84.36%,总成本 33.27 美元;GPT-5.6 Luna(Extra High)发布时得分 84.04%,成本只要 1.33 美元——性能几乎持平,价格掉了二十多倍,而且 OpenAI 后来又降了一轮价。
所以选模型的思路要换:高并发、低延迟、智能体流程里的重复环节,优先考虑 Terra 或 Luna 这类小模型。比如做法律科技的团队,解析手写备忘录这种活儿,完全可以让 Terra/Luna 先做抽取,再交给更强模型做分析,成本能省出很大一块。
Responses API 三大新能力
光靠模型本身还不够,OpenAI 这次还给 Responses API 加了三组新能力,专门用来帮智能体跑得更省、更快、更稳。
第一是推理持久化:允许推理过程跨轮次保存,配合原生压缩,长对话里模型不用每次重新拼上下文,任务跨度再长也不会乱。第二是原生多智能体编排:一个主智能体可以把任务拆给多个子智能体并行处理,复杂任务完成速度明显提升。第三是程序化工具调用:把过滤、汇总、编排这类确定性工作交给代码,模型只负责需要判断力的部分,上下文窗口不再被中间结果塞满。
三个能力叠加的效果很惊人。在 ARC-AGI-3 上,GPT-5.6 Sol 用标准 harness 得分 13.3%;开启推理持久化和压缩后,直接跳到 38.3%,输出 token 还少了约 6 倍——模型没变,只是架构用对了。

程序化工具调用:把机械活交给代码
智能体工作流里其实有两类事:一类需要判断力,一类只是搬运、过滤、合并数据。以前模型要在上下文窗口里把每个中间结果都过一遍,既费 token 又容易”上下文腐烂”。
程序化工具调用让 GPT-5.6 直接写 JavaScript 来编排工具:并行跑独立调用、在上下文窗口外处理输出,模型只专注真正需要智力的部分——做判断。金融研究公司 Rogo 的评估是:用上这个能力后,输入 token 少了 21%,输出质量还和原来对齐。”这区别就在于,一个智能体能讨论金融研究,一个能真正把它做出来。”
多智能体:并行干活,主智能体收口
面对复杂又可拆分的任务,把动作和推理分散到多个智能体工作流里,完成速度和智力上限都会更高。架构上就是主智能体负责调度,子智能体并行推进自己的目标,最后把结果交回主智能体做汇总。ChatGPT 里的 ultra 能力档位,底层就是这套机制。
多智能体行为也是可调的:虽然 GPT-5.6 自己就很清楚该开几个子智能体、什么时候开,但你完全可以显式告诉它”什么情况下才允许派生子智能体”,避免在没必要的地方多花 token。
Prompt 缓存升级:30 分钟起步
整个 5.6 家族的 prompt 缓存 TTL 都延长到了最少 30 分钟,缓存断点也可以在模型上下文窗口内确定性地设置。这意味着同一段上下文,智能体可以在多次运行间复用,不用每次从零开始。
AI 工程公司 Ploy 的做法很典型:在共享的 29000 token 提示词里加了缓存断点和按工作区区分的 key,未缓存输入直接砍掉 28%。再加上合适的 prompt_cache_key,请求更容易命中之前服务过相同前缀的推理引擎,延迟也跟着降。
结语
把这些例子串起来看,最值得注意的不是某个单一数字,而是构建智能体的经济学真的变了。以前每个环节都得用旗舰模型硬顶的场景,现在换小模型、调推理档位、做合理的架构选择,就能拿到接近甚至更好的结果,成本却只剩零头。
对开发者来说,这轮更新的核心就一句话:会选模型、会用新 API,比无脑上旗舰省得多。GPT-5.6 已经把工具备齐了,接下来就看怎么用了。