OpenAI 披露,GPT-5.6 在 ARC-AGI-3 上的明显增益,并非来自更换模型,而是两项 API 配置:保留推理信息,以及启用 compaction。按文章标题给出的结论,调整后得分达到原先约三倍;摘要还指出,整体效率同步改善。这说明评测结果不仅取决于模型本身,也会受到调用与上下文管理方式影响。
两项设置改变了什么
“保留推理”意味着系统在后续交互中继续利用已有推理信息,而不是让此前过程完全丢失。compaction 则可理解为在交互持续时整理或压缩上下文,以控制长历史带来的负担。两者放在一起,一项侧重维持推理连续性,另一项侧重管理上下文规模。
不过,现有材料只说明两项设置共同带来分数与效率提升,没有给出各自的独立贡献,也没有说明具体参数、压缩方法和调用流程。因此,不能判断主要增益来自哪一项,更不能确认二者是否存在额外的组合效应。
对评测与应用的启示
同一个模型版本,在不同 API 配置下可能呈现出显著不同的基准成绩。对需要多步处理的系统,是否保留中间推理、如何处理持续增长的上下文,都可能成为实际性能的一部分。报告模型成绩时,除了模型名称,也应记录关键运行设置,否则横向比较容易把系统配置差异误判为模型能力差异。
同时,“得分翻三倍”不等于基础推理能力发生同等幅度变化。更稳妥的解读是,这些设置减少了调用链路中的信息损失或上下文负担,让 GPT-5.6 更充分地发挥已有能力。
我的判断
这项结果最有价值的地方,是提醒团队在换模型或增加预算前,先检查推理状态保留与上下文管理。它对多轮评测和长流程应用有参考意义,但适用边界仍不清楚:材料未提供具体分数、成本变化、消融实验或复现结果,无法判断收益是否稳定,也不能直接外推到其他基准与生产负载。现阶段应把它视为值得验证的工程经验,而不是普遍规律。