文本空间优化不修改大模型权重,而是持续编辑外部自然语言制品,因此结果可检查,也能把底层模型当作黑盒使用。DecoEvo关注其中一个容易被忽视的瓶颈:当求解器已经学会满足现有评分规则时,规则未覆盖的能力维度不会产生优化信号,继续迭代也可能只是在重复强化已解决的问题。

固定评分规则为何会失效

开放式任务通常没有单一、完备的评价标准。固定规则能够指出已知缺陷,却难以发现规则之外的新问题。如果直接让评分规则随求解器共同演化,又用当前求解器的总分选择更新,系统可能通过降低规则难度获得表面进步,而不是真正提升回答质量。换言之,求解器与评测器若共享同一个总分目标,就可能把“能力提高”和“标准变松”混在一起。

用解耦目标组织共同进化

DecoEvo同时维护求解器技能和评分规则生成器技能,但不在优化过程中使用金标准评分规则。求解器依据细粒度的单项标准反馈更新;规则生成器则接受两类互补审计:一类检查任务要求是否被充分覆盖,另一类检查规则能否区分不同回答。这些审计独立于求解器的汇总得分,使规则更新更聚焦于新暴露的薄弱点,并减少反复强调求解器已经满足的标准。

论文按各基准的官方评测方式比较结果。DecoEvo在五个基准、三个大模型骨干上均超过所有对比方法;相较 SkillOpt,五基准平均成绩获得 2.8%—5.0% 的相对提升。材料未给出各任务的具体分项结果,因此尚不能判断收益主要来自哪些任务类型。

我的判断

这项工作的价值不只是“同时优化两个提示文本”,而是明确切断评分规则更新与求解器总分之间的捷径,让评测标准承担发现盲区的职责。它尤其适合评价维度不完整、输出较开放且模型只能以黑盒方式调用的场景。边界也很清楚:规则生成仍依赖覆盖性与区分性审计,这些审计本身是否可靠,会直接影响共同进化的方向;目前材料只报告五个基准和三个骨干上的结果,泛化到更多任务、模型及长期迭代时的稳定性仍需进一步验证。