视觉生成中的文本条件长期缺少清晰的缩放规律:自然语言提示词变长,并不会让扩散损失像语言模型损失那样随 token 数稳定变化。这项工作把关注点从“写了多少”转向“语言有多结构化”,并在受控训练中观察到明确的经验关系,为提示词构造和训练流程提供了一个更具体的优化坐标。

结构量,而非 token 数

作者引入两种互补指标来量化提示词中的结构化语言:白盒似然指标 GPG,以及黑盒属性指标 ED。实验结果显示,模型收敛后的扩散损失会随着 GPG 增加而近似线性下降;以 ED 衡量时,则呈现幂律关系。

这里的重要性不在于某一个指标本身,而在于它说明文本条件中的结构化信息可能存在可测尺度。单纯统计 prompt 长度,会把内容组织方式、属性表达和空间关系等差异压缩成同一个 token 数,因而难以解释扩散模型实际获得了多少有效条件。

从经验规律到训练系统

研究进一步把这些规律用于两类改进。第一类面向 diffusability:从图像中提取语义与几何标注,构造更结构化的提示词,让视觉内容更适合被扩散模型学习。第二类面向 promptability:通过监督微调、冷启动,以及由验证器把关的 on-policy 蒸馏训练一个 prompter。

最终系统相较论文评测覆盖的全部开放权重模型,在几乎所有组合性、推理和世界知识基准上取得更好结果;与最强闭源模型相比,也在多数评测中持平或超过。这个结论应严格限定在作者选择的模型和基准范围内,不能直接外推为全面领先。

我的判断

这项工作的价值,是为文本到图像系统补上一个比 token 数更有解释力的经验尺度,并把测量结果闭环到数据构造与提示器训练中。对需要改善复杂指令遵循、空间关系表达或知识组合能力的团队,它提供了一条值得验证的路线:先量化结构,再改造提示与训练。

不过,摘要没有给出 GPG、ED 的具体定义、拟合区间、模型规模、数据分布和计算成本,也无法判断规律跨架构、跨数据集的稳定性。最终成绩还同时受到结构化标注、prompter 和验证器蒸馏等多项改动影响,因此不能仅凭整体结果认定缩放规律就是全部增益来源。