递归自我改进常被描述为模型持续增强自身能力,但这项工作把问题收敛到一个可执行的场景:让 AI 改进构建 AI 的过程。Frontis-MA1 是一个面向机器学习工程的 35B 参数“元演化智能体”,重点不是单次生成代码,而是结合执行反馈,持续搜索和演化解决方案。

从执行环境到长程搜索

研究团队提出了开放的全栈系统 OpenMLE。OpenMLE-Gym 提供可验证、带执行反馈的任务环境;OpenMLE-RL 负责算子学习;OpenMLE-Evo 则进行长程搜索。三者分别覆盖环境、训练与推理搜索,使机器学习工程成为研究递归自我改进的具体试验场。

Frontis-MA1 的训练与推理围绕四种原子程序演化算子展开:Draft、Improve、Debug 和 Crossover,分别对应起草、改进、调试与交叉组合。模型通过基于执行结果的监督微调和强化学习掌握这些算子,再在推理阶段将它们组合成长程搜索。训练数据与全部评测基准进行了去重,意在降低评测污染风险。

受限硬件下的评测结果

在 MLE-Bench Lite 上,每个任务限时 12 小时,使用一张 RTX 4090,并将显存限制为 12 GB。基础模型的 Medal Average 为 39.39%;Frontis-MA1 配合 OpenMLE-Evo 后达到 60.61%,使用加入基准无关经验先验和异步搜索的 OpenMLE-Evo-Max 后达到 71.21%。论文称这一结果超过 GPT-5.5 + Codex,并接近 GPT-5.6 Sol 与 2.8T 参数的 Kimi K3。

在未参与训练的 NatureBench Lite 上,模型和框架也分别表现出迁移效果:固定框架、替换为训练后的模型,Match-SOTA 从 50% 提升到 70%;固定模型、替换为 OpenMLE-Evo,则从 20% 提升到 50%。这说明收益并非只来自模型权重或搜索框架中的单一一侧。

我的判断

这项工作的价值在于把“自我改进”拆成可训练、可执行、可验证的工程算子,并让训练阶段与推理阶段使用同一套操作语言。它更像一个机器学习工程搜索系统,而不是能够任意改写自身的通用递归智能。

目前结论主要建立在两个 Lite 基准及特定计算预算上,摘要也未给出完整版本任务、搜索成本和失败类型,因此不宜外推为普遍的 AI 研发自动化能力。更值得关注的是其开放模型权重与 OpenMLE 全栈后,结果能否被复现,以及长程搜索带来的收益能否覆盖额外推理成本。