离散去噪扩散模型正被视为自回归建模之外的一条生成路线:它可以并行生成,并通过多轮迭代对结果做全局修正。这篇工作没有把重点放在提出某个新模型,而是尝试回答一个更基础的问题——不同离散扩散方法究竟共享怎样的设计空间。
统一视角:状态空间先于去噪
连续扩散通常在固定状态空间中讨论噪声与反向恢复;离散扩散则不同,其行为首先取决于离散状态空间如何构造。论文把分词方案、词表拓扑以及面向具体领域的结构化字母表放到框架中心。这意味着,tokenization 不只是进入模型前的数据处理步骤,也会直接塑造扩散过程能够表达的状态、状态之间的关系,以及模型需要学习的恢复任务。
在这一视角下,基于转移矩阵的方法、使用掩码或吸收状态的方法,以及基于 score 或 ratio 的方法,不再只是彼此分离的技术路线,而是同一设计空间中的不同实例。统一框架的价值主要在于提供共同坐标系,帮助研究者比较这些方法分别如何定义状态、施加扰动并完成反向生成。
从算法分类走向系统权衡
论文进一步把训练目标、推理算法、扩展行为、系统优化和评测协议放到同一组设计权衡中讨论。这个范围很重要:离散扩散是否实用,不能只看训练目标是否成立,还要同时考虑迭代生成带来的推理过程、并行能力如何转化为系统收益,以及不同方法是否在一致的评测设置下比较。
摘要没有给出具体实验数字,也没有证明离散扩散已经在质量或成本上全面优于自回归模型。因此,这项工作的主要贡献应理解为概念整理与问题重构,而不是性能结论。它也据此指出了若干未来研究方向,但现有材料不足以判断哪些方向最可能率先取得突破。
我的判断
这套框架最有价值的判断是:研究离散扩散时,不能把词表和离散结构视为固定背景。对文本、代码或其他结构化离散数据而言,状态空间设计可能与去噪算法本身同样关键。它适合用来整理方法、设计对照实验和检查评测口径,但不能直接回答模型质量、推理成本或规模化效果。是否能推动实际系统,还要等待具体模型、实验和系统数据验证。