自主智能体已经开始尝试端到端执行机器学习研究,但模型会解释一种方法,并不等于能稳定地把它运行起来。论文将两者之间缺失的部分称为“操作知识”:包括如何配置、组合和执行现有工具,以及如何避开实践中的常见问题。这些知识通常散落在论文和代码仓库中,既面向人类读者,也很难在单次任务中完整装入上下文。
从代码仓库提炼技能
论文提出研究智能体 DisCo,把技能的创建和使用纳入研究流程。其蒸馏分为两种形式:任务无关蒸馏面向通用生态,将广泛使用的代码仓库压缩成可跨任务复用的技能;任务导向蒸馏则围绕当前研究目标,生成完成具体任务所需的技能。核心思路不是让智能体每次重新阅读大型仓库,而是预先把其中可执行、可验证的经验整理成更紧凑的知识单元。
基于任务无关蒸馏,作者构建了 AREX-Skill Library。该库从 1000 个广泛使用的机器学习仓库中提炼出超过 5000 项经验证技能,覆盖 20 个领域和 178 个能力族。这一规模说明,代码仓库不只是工具集合,也可以被视为承载领域实践经验的数据源。
固定条件下的基准收益
论文将 GPT-5.5 主干模型、研究执行框架和下游执行预算保持不变,仅比较是否向智能体提供技能。加入技能后,DisCo 在 MLE-bench 上的得分相对提高 134.3%,在 PaperBench、FrontierCS 和 PassNet 上分别提高 34.4%、9.2% 和 14.0%。这种对照设计支持一个直接判断:智能体能力不只取决于模型本身,外置且可复用的操作知识也可能显著影响研究执行效果。
不过,这些百分比是相对提升,材料没有给出各基准的绝对分数、失败类型和技能调用成本,因此不能据此横向判断任务是否已经达到可靠自动化水平。
我的判断
这项工作的价值,在于把代码库检索进一步推进到“可执行经验复用”:知识不再只是被找到的文本,而是经过压缩和验证、可在任务中调用的技能。它尤其适合依赖成熟开源工具链、重复操作较多的机器学习研究。边界也很明确:现有结果来自固定模型和框架下的基准测试,尚不足以说明技能能跨模型、跨版本长期稳定迁移。技能如何验证、仓库更新后如何维护,以及错误技能会否被规模化复用,仍是实际部署时必须评估的问题。