LLaDA-Image的重点不只是刷新一次图像生成评测,而是尝试给出一条相对完整的开放训练路线。该框架将从零训练的60亿参数扩散Transformer(DiT),与一个冻结的视觉语言理解模块结合;后者建立在LLaDA2.0-Mini扩散语言模型骨干之上。团队同时承诺开放模型权重、训练代码和详细配方,使其价值不局限于最终模型。

先建立视觉生成先验

常见文本生成图像训练较早依赖图文配对数据,LLaDA-Image则先进行纯图像预训练和中期训练,以建立视觉生成先验,再利用理解模块处理文本条件和编辑指令。这种分工让生成能力与语言理解能力可以分别建设:DiT负责图像生成,冻结模块提供视觉语言理解,减少联合训练时需要同时调整的部分。

论文称完整生成流程使用2.2亿个样本。摘要原文同时写道其中“98个”为真实图像,但没有说明这里是否存在单位省略,因此不能据此判断真实图像的具体规模或数据构成。训练侧,模型在DiT中统一使用无可学习参数的RMSNorm,并采用Muon优化器,目标是提高大规模训练的效率与可扩展性。

评测与加速版本

在Qwen-Image-Bench上,LLaDA-Image英文与中文赛道总分分别为53.53和53.38。论文据此称其在两个赛道均达到开源模型中的新最佳水平。除基础版本外,团队还蒸馏出LLaDA-Image-Turbo,将推理压缩到2至4个采样步骤,面向更看重延迟和吞吐量的部署场景。摘要还强调模型具备较强的照片真实感,并能遵循细粒度图像编辑指令。

我的判断

这项工作的主要价值,在于把图像先验训练、冻结的理解模块、DiT优化方案和少步蒸馏放进同一套开放框架,为研究者复现和拆解现代图像生成系统提供入口。双语基准成绩也说明其中文能力值得关注。

边界同样明确:当前材料只给出单一基准的总分,缺少与闭源模型、不同任务类别及推理成本的完整对照;“高照片真实感”和编辑准确性也需要更多独立评测验证。数据描述中的数量歧义进一步限制了对训练成本与开放程度的判断。因此,它更适合作为一套可研究的开源训练基线,而不是仅凭摘要就认定为全面领先的生成方案。