SenseNova-U1.5的核心方向,是把视觉理解、视觉推理和视觉生成放进同一个原生统一的多模态模型中。论文介绍的模型规模为8B,采用MoT架构,并且不依赖编码器和VAE。相比把理解模型、扩散模型或编辑模块拼接在一起,这条路线试图让系统在端到端框架内完成从感知到创作的连续处理。论文称,该模型在多项视觉能力上取得了较大进展,但材料没有给出具体评测数字,因此更适合关注它的架构取舍和训练方法。
从视觉接口到原生生成
SenseNova-U1.5通过具有空间一致性的图像块重建,强化模型的视觉接口。简单说,模型不只是读取图像中的语义,也需要保留视觉内容在空间上的组织关系,这为后续的构图、编辑和生成提供基础。训练阶段使用了经过筛选的生成与编辑数据,同时改进了任务设计、结构化提示增强,并支持最高4K的原生分辨率。
这里的“统一”并不意味着所有能力都依靠同一种训练信号自然出现。论文还针对视觉美学、双语文字渲染、信息图生成和图像编辑,分别优化了专门的专家模块,之后再通过多专家在线蒸馏,把这些能力整合到统一模型中。也就是说,模型的通用性来自统一架构,但能力提升仍然依赖任务拆分和针对性训练。
评测重点转向复杂视觉任务
材料显示,SenseNova-U1.5重点改善了图像保真度、文字渲染、复杂构图、多参考图编辑和交错生成,并在指令遵循、主体身份保持、几何关系以及未修改区域保持方面有所提升。它还表现出对长文本、复杂和结构化视觉指令的较好泛化能力,即使生成数据中接触结构化格式的机会有限,也能把多模态理解迁移到视觉规划与创作中。
这一点值得关注:视觉生成不再只是根据一句短提示词产出一张图,而是开始处理包含多个约束、参考对象和局部修改要求的任务。对于信息图、复杂版式和多轮编辑,这类能力比单纯追求画面风格更接近实际使用需求。
我的判断
SenseNova-U1.5展示了原生统一建模的一种可行路径,价值在于减少理解、规划和创作之间的系统割裂,并为复杂视觉指令提供统一处理框架。它的适用边界也很清楚:论文材料主要说明了架构、训练策略和总体评测结论,尚不足以判断其与其他模型在具体场景中的差距,也无法据此确认部署成本和稳定性。8B规模并不等于低成本,4K生成、多专家训练和在线蒸馏同样会带来工程复杂度。后续如果开放训练代码,社区更有机会验证这套方法的可复现性,以及统一模型在真实编辑流程中的收益。