世界模型的输出不能只看画面是否逼真,还要判断物理规律、因果关系和世界状态是否持续正确。HarnessEval-W 的核心主张是:可信评测不应只交付一个标量分数,还应给出能够检查和验证的推理依据。

从固定指标转向按案例组织评测

传统评测通常依赖预设指标,以相对固定的方式计算结果。材料指出,这种做法难以留下可供审查的推理链,也无法像人类一样针对具体生成轨迹识别物理、因果或状态演化中的异常。

HarnessEval-W 将大语言模型生态中的 harness 思路引入世界模型评测。它不会直接套用固定量表,而是先理解每个评测案例的上下文,再把原始问题拆成多个可测量的子问题。由此,评测过程从一次统一打分,变成针对当前案例动态组织的诊断流程。

子智能体取证,父智能体汇总裁决

系统会为不同子问题创建专门的子智能体,并分别提供定制上下文和诊断工具。每个子智能体只处理自己的局部任务,产出相应证据;父智能体随后检查这些证据,并汇总为最终判断。

这一分层结构最终形成一棵透明的证据树:结论不仅包含结果,还保留从问题拆解、局部分析到最终裁决的完整链条。作者在18个具有代表性的世界模型、330个评测案例上应用了该流程,并称其判断与人类偏好较为接近,同时能够为每条生成轨迹提供细粒度、可验证的诊断。完整流程已开源,并以动态基准的形式供社区扩展技能与评测案例。

我的判断

HarnessEval-W 的价值不在于再造一个综合分数,而在于把评测本身变成可检查的智能体工作流。对需要定位具体失真原因的世界模型研发,这类证据树比单一排名更有工程意义,也更便于人工复核。

但现有材料没有给出与人类偏好一致程度的具体数字,也未说明运行成本、工具依赖及不同错误类型上的稳定性。330个案例可以展示方法可行性,却不足以据此判断其对所有世界模型和开放场景的泛化能力。现阶段更适合把它视为一种透明评测框架,而不是已经替代人工判断的最终裁判。