OpenAI最近给GPT-5.6 Sol装上了”加速器”。新发布的Ultrafast模式预览版,借助Cerebras的硬件支持,把推理速度拉到了标准模式的14倍,每秒最多输出750个token。

这个数字意味着什么?过去想要AI实时响应,开发者只能退而求其次选小模型或专用模型——要智能还是要速度,只能二选一。Ultrafast想解决的就是这个矛盾:让最强模型也能跑出实时速度。
速度提升后能干什么
速度不再成为牺牲智能的代价后,GPT-5.6 Sol能进入那些对响应时间极其敏感的业务场景。OpenAI列举了几个方向:
- 故障应急响应:系统出问题时,快速分析日志、代码变更和工程师报告,在故障还在发生的过程中就定位原因并准备修复方案。
- 金融研究与风控:实时分析市场信号和交易数据,在行情还在变化时识别可疑活动。
- 客服与语音交互:不用打断对话节奏,即使需要多步查询或跨系统调用也能实时解决用户问题。
- 电商:在用户还在犹豫时,实时回答商品问题、查库存、给推荐,避免弃单。
- 科研实验:过去要跑一整夜的实验,现在可以变成交互式工作会话,测一个想法、看结果、调整方案、再跑一轮,全程不中断。
首批客户怎么说
Ultrafast模式目前处于限量预览阶段,OpenAI正与首批客户合作测试,了解极速推理在哪些场景价值最大。参与测试的公司包括Jane Street(金融)、Podium(客服)、Basis(电商)、Rogo(金融研究)等。
Jane Street的AI助手团队工程师John Crepezzi评价说:”Cerebras带来的速度提升令人印象深刻,它让开发者能以更专注、更高效的方式与模型协作。”
OpenAI自己也在用
OpenAI内部也在用Ultrafast。工程团队在故障告警时用它快速读取日志、分析调用链、整理上下文,大幅缩短从发现问题到验证修复方案的时间。研究团队则用它加速知识检索和数据查询,把原本需要过夜批量跑的实验缩短为工作时间内多次迭代。
Ultrafast模式由OpenAI与Cerebras合作实现,这是双方在超低延迟推理领域的进一步合作。目前GPT-5.6 Sol Ultrafast模式仅向部分客户开放,后续会随产能扩充逐步扩大范围。