现有 AI 评测大多关注模型能否调用已有知识给出正确答案,或在充分的人类指导下完成任务。ASI-Bench试图把问题推进一步:当研究目标不变、方法提示逐渐减少时,AI还能独立探索未知问题,并把想法转化为可验证的科研结果吗?
从答题能力转向科研执行
ASI-Bench被作者称为首个同时评估创新探索与自主科学执行能力的基准。它包含60个项目级研究任务,覆盖11个科学领域,由40多位专家投入超过31,000小时构建。与单轮问答不同,这些任务要求系统处理更完整的研究过程,包括选择方法、开展研究和提交可验证结果。
任务还经过专家审查、AI辅助审计、沙箱执行与评分器验证。这套流程的重要性在于,评测对象不只是语言表达或方案描述,而是研究结果能否在受控环境中接受检查。不过,摘要没有披露各领域任务的具体分布、任务难度以及验证标准之间的一致性,因此暂时不能判断它对真实科研工作的覆盖程度。
撤掉指导后,能力断层出现
基准在同一研究项目中逐步减少人类提供的方法论指导。对18种前沿智能体与模型组合的测试显示:提供完整方法指导时,平均得分为50.91;只指定方法时降至29.10;需要智能体自行确定方法时进一步降至26.62。
这组结果区分了三种容易被混为一谈的能力:按照详细步骤执行、在给定方法下组织研究,以及从问题出发自主决定方法。最大幅度的下降发生在完整指导被撤去之后,说明当前系统的表现仍明显依赖人类提供研究路径。仅从摘要来看,尚无法比较不同配置的稳定性,也不能据此判断某个具体模型已经具备或缺乏通用科研能力。
我的判断
ASI-Bench的价值,在于把“科研智能体是否自主”转化为可分层观察的问题,而不是只看最终答案或演示效果。它尤其适合检验方法选择与执行之间的能力差距,也能帮助开发者识别智能体究竟需要哪一层人类脚手架。
但它仍是一个由预设任务、沙箱和评分规则构成的基准,不能直接等同于开放世界中的科学发现,更不能仅凭名称推断人工超级智能已经临近。当前最稳妥的结论是:现有系统在获得完整方法指导时表现更好,而自主确定研究方法仍是明显短板。