OpenAI 预览了新的 API 服务档位 Ultrafast,借助 Cerebras 加速 GPT-5.6 Sol,宣称运行速度最高提升 14 倍,峰值输出吞吐达到每秒 750 token。现有材料显示,这是一项服务层更新,并非模型能力升级。

服务档位而非新模型

Ultrafast 的核心是提高生成速度。开发者使用的仍是 GPT-5.6 Sol,但可选择更快的 API 档位。对长文本回复、代码生成和实时对话而言,更高的输出吞吐有望缩短生成阶段,让用户更快看到完整结果。

需要注意,官方使用的是“最高”表述。材料未说明 14 倍所对应的基准档位,也没有给出输入与输出长度、并发水平或测试方法。因此,这两个数字更适合作为峰值能力参考,不能直接视为每次请求的稳定表现。

接入前还缺哪些信息

摘要没有披露定价、开放范围、速率限制、可用区域和稳定性承诺,也没有提供首 token 延迟。每秒输出 token 数衡量的是持续生成速度,不足以单独说明端到端体验;对于短回复,开始返回的速度可能更重要。

材料也未提供质量、准确率或模型行为对比,因而无法判断提速是否存在其他权衡。团队应在自身负载下测试首 token 延迟、完整响应时间、并发吞吐和错误率,再结合成本决定是否采用。预览阶段适合先做小流量验证。

我的判断

Ultrafast 的价值清晰:OpenAI 把高吞吐推理做成可选服务档位,最高每秒 750 token 对长输出和实时交互很有吸引力。它适合延迟敏感、输出较长,且愿意单独评估成本与容量的应用。

但当前信息仍不足以支持生产级结论。14 倍不代表所有端到端请求都会等比例提速,更不意味着模型质量提升。在价格、基准条件和服务保障公布前,我会把它视为值得测试的性能选项,而不是默认替代方案。