GPT-5.6开发者指南:更便宜的价格,更强的智能体,新API怎么用一次讲清

GPT-5.6 发布那天,OpenAI 给开发者的说法就一句:前沿级别的智能体能力,这次便宜得明显。说实话我一开始当宣传话术听的,直到看见 BrowseComp 上那组数。三个月前 GPT-5.5 开 Extra High 档,得分 84.36%,总成本 33.27 美元。换成 GPT-5.6 的 Luna,同样 Extra High,得分 84.04%,花了 1.33 美元。分数基本没动,钱差了二十多倍,而且 OpenAI 后来又降了一轮价。那天我正好有个跑旗舰模型的项目要续费,看完顺手把自动续费关了。

GPT-5.6 API成本对比

这跟那种新模型性能提升百分之多少的例行更新不一样,它把你过去选模型的整套习惯作废了。以前只有旗舰扛得动的活,现在小模型、低档位就能接。一条条看。

拉满推理档位的老习惯,该戒了

以前碰上长任务,流程闭着眼都能背出来:换旗舰,推理档位拉到 high,因为便宜模型处理长上下文和工具调用确实吃力。Agents’ Last Exam 上有个很拧巴的结果,GPT-5.6 Sol 只开 low 档,跑赢了 GPT-5.5 开 high 档的成绩。也就是说,以前必须拉满的场景,现在降一档甚至两档都够用。

AI 研究公司 Hex 把 GPT-5.6 接进自家 harness 之后,发现最好的结果恰恰出在低推理档位上。他们的原话是,它知道数据什么时候不在那里,不会去追错误线索,用更少的 token 就找到了正确答案。

这条路线其实从 GPT-5 就定了,每一代都往用更少的 token 干更长远的任务上凑,5.6 接着往前跑:智能体性能更强,成本更低,底层 harness 几乎不用动。我个人觉得最值钱的是最后这半句,你沉淀下来的工程不用推倒重来。

98% 的活,小模型接得住

文档处理公司 Hypha 实测,Luna 的信息抽取准确率保住了 GPT-5.5 约 98% 的水平,成本只有十八分之一。就冲这个性价比,他们把高质量文档理解铺进了更多工作流。做法律科技的团队路子也类似:手写备忘录先让 Terra 或 Luna 抽一遍,结果再交给强模型做分析,账面上省出一大块。

所以选模型的优先级可以倒过来了。高并发、低延迟这类场景先考虑小模型,Terra、Luna 都行。智能体流程里那些重复的环节也一样,多投入一点测试时计算,它们的表现常常能对齐 GPT-5.4 和 5.5。旗舰留在真正要判断力的地方。

模型没换,分数从 13.3% 跳到 38.3%

跟模型一起发的 Responses API,多了三组能力。推理持久化,推理过程可以跨轮次保存,配上原生压缩,长对话不用每次从头拼上下文。原生多智能体编排,主智能体把活拆给一堆子智能体并行干。还有程序化工具调用,过滤、汇总这类确定性工作交给代码去跑。单看介绍都挺平淡的。

但 ARC-AGI-3 上的数字不平淡。GPT-5.6 Sol 用标准 harness 得分 13.3%,把推理持久化和压缩打开,直接跳到 38.3%,输出 token 还少了约 6 倍。模型没换,纯粹是架构用对了。我第一次看到这组数,就回头把自己几个一直没开持久化的项目挨个改了配置。

机械活交给代码,模型只管判断

智能体的活其实混着两类,一类要判断力,一类纯属搬运、过滤和合并数据。以前模型得在上下文窗口里把每个中间结果过一遍,token 烧得快,还容易上下文腐烂。

程序化工具调用让 GPT-5.6 直接写 JavaScript 来编排工具:独立调用并行跑,输出在上下文窗口外处理,模型只盯真正需要智力的那部分。金融研究公司 Rogo 用下来,输入 token 少了 21%,输出质量没掉。他们有句话说得挺狠:一个智能体能讨论金融研究,一个能真正把它做出来。

GPT-5.6程序化工具调用

多智能体那套也是现成的:主智能体调度,子智能体并行推进各自的目标,结果交回主智能体汇总,ChatGPT 里的 ultra 能力档位底层就是这套机制。它自己清楚该开几个、什么时候开,你也可以显式规定什么情况下才允许派生子智能体,省得在不必要的地方烧 token。

缓存 30 分钟起步,最容易忽略的省钱项

整个 5.6 家族的 prompt 缓存 TTL 延长到了最少 30 分钟,缓存断点还能在模型上下文窗口内确定性设置,同一段上下文在多次运行之间可以复用。AI 工程公司 Ploy 的玩法:共享的 29000 token 提示词里加缓存断点,配按工作区区分的 key,未缓存输入直接砍掉 28%。再挑个合适的 prompt_cache_key,请求更容易命中之前服务过相同前缀的推理引擎,延迟也跟着降。这个改动不起眼,但属于你不主动配、就一分钱都省不着的类型。

这轮更新里模型、API 和缓存各改各的,指向其实是同一件事。会选模型、会搭架构,比无脑上旗舰省得多。工具是备齐了,至于你自己流程里哪一环最烧钱,OpenAI 不知道,得自己翻账单去。