科学发现常要在分子、蛋白质序列或程序等庞大且结构化的空间里,优化一次评估成本很高的目标。生成模型能提供灵活的候选先验,但模型概率和自我评价并不等于真实实验表现,对分布外新候选也难以给出校准后的认知不确定性。LDM 的出发点,就是让搜索过程持续接受实验数据约束。

生成模型与奖励代理分工

Large Discovery Model(LDM)采用循环式架构,将生成模型和贝叶斯非参数奖励代理模型结合起来。生成模型负责提出并迭代候选设计;代理模型根据已有观测预测候选性能,同时量化不确定性。系统据此构造具备不确定性感知的价值信号,用来指导候选的生成、改进和最终选择。

这一设计没有把 LLM 的反思或置信判断直接当作可靠评价,而是引入独立的统计代理。每获得一次新的实验观测,发现记忆和代理模型都会继续更新,再进入下一轮搜索。因而,模型先验负责拓展开放式假设空间,真实观测则不断修正搜索方向。

三类任务上的结果

论文在神经网络训练、抗体设计和分子优化三种场景中评估 LDM,覆盖不同设计对象与优化目标。与仅依赖 LLM 反思或传统统计搜索的方法相比,摘要报告其验证集 BPB 降幅提高到 2.4 倍,结合能相对下降 18.2%,分子多目标性能的相对增益超过 60%。这些结果表明,在生成能力之外显式建模经验奖励和不确定性,可能比让模型自行判断候选优劣更有效。

我的判断

LDM 的价值不在于提出又一种提示或反思流程,而在于把生成式先验、实验反馈和不确定性估计放进同一个持续更新的搜索闭环。它尤其适合候选空间开放、单次验证昂贵、但仍能逐步获得可靠观测的任务。边界也很明确:代理模型的质量依赖实验数据,真实评估仍不可省略;仅据摘要,还无法判断其样本效率、额外计算成本、不同基线的具体设置及结果稳定性。现有数字值得关注,但不足以直接推断它能普遍替代传统优化方法。