BDH-CQ尝试把两种能力放进同一套推理机制:一边从测试时提供的示例中学习,一边在潜空间内反复计算。它不需要把中间推理过程转写成自然语言,而是持续更新循环记忆,再据此求解当前查询。论文将重点放在ARC-AGI-1,结果显示,小参数配置也能在成本与准确率之间取得有竞争力的平衡。
循环记忆连接上下文学习与潜空间推理
BDH-CQ接收推理阶段的输入后,会持续更新模型内部的循环记忆。面对查询时,模型不是一次前向计算后直接给出答案,而是在高维潜空间中执行多轮迭代计算。其核心区别在于,中间推理不会被显式语言化,因此不能简单等同于生成一段可见的思维链。
这种设计把示例学习与任务求解连接起来:演示样例负责改变循环记忆,后续迭代则利用更新后的内部状态推断并执行变换。论文还通过受控的类ARC干预,考察模型究竟从演示中学到了什么、能否稳定应用推断出的变换,以及哪些概念仍然困难。不过摘要没有给出这些分项实验的具体结果,因此暂时无法判断模型的主要错误类型。
150M参数版本突破成本—准确率前沿
在公开的ARC-AGI-1评测集上,150M参数配置达到29.5% pass@2,折算的单任务推理成本为0.0007美元。需要注意,pass@2表示允许两次尝试后的通过率,不能直接视为单次作答准确率;0.0007美元也是论文计算得到的推理成本,并非适用于所有部署环境的固定价格。
按照论文摘要的表述,这个运行点突破了此前报告的ARC-AGI-1成本—准确率帕累托前沿,并刷新该基准的成本效率纪录。这里的贡献重点不是绝对通过率最高,而是在给定成本下获得更好的评测结果。
我的判断
BDH-CQ的价值在于展示了一条不依赖显式推理文本的测试时计算路径:上下文示例先进入循环记忆,模型再用潜空间迭代完成求解。对结构化、可由少量演示定义变换规则的任务,这一方向值得继续验证。但当前证据集中在ARC-AGI-1及类ARC干预,尚不足以外推到更广泛的语言、代码或真实应用任务。潜空间推理不输出中间过程,也意味着行为分析与错误定位可能更困难。现阶段更稳妥的结论是:它刷新了特定基准上的成本效率,而不是已经证明了一种普适推理架构。