当一张图片需要同时包含多位指定人物时,身份保持会迅速变得不可靠。模型不仅要生成相似的面孔,还要把每个参考身份绑定到不同的人物和位置,避免身份混淆、重复人物或直接复制参考脸。Hugging Face Daily Papers 收录的 WithEveryone,针对这一问题提出了一个面向多人身份生成的统一框架,支持最多十个参考身份。

从身份输入到布局规划

WithEveryone首先把每个被选中的身份注入为一个带地址的 token,使不同参考身份在生成过程中具备明确区分。随后,模型预测一个结构化的身份与布局计划,描述人物身份和空间位置之间的对应关系,再把这份计划渲染为视觉条件,交给后续图像合成使用。

这个设计的重点不只是增加身份信息,而是显式建立身份与位置之间的关系。对于多人场景而言,模型需要知道某个身份应该出现在画面的哪个人物区域,同时保持其他身份彼此独立。论文将这种规划和渲染放进同一套框架中,试图降低多人生成中的对应错误。

两个损失函数解决对应问题

WithEveryone的核心目标是Layout-Grounded ID Loss。它利用标注的人脸区域,直接监督预期身份应该落在哪个区域,避免依赖基于嵌入的人脸匹配。论文认为,在多个噪声较大的预测人脸之间进行嵌入匹配,训练过程容易不稳定;区域级监督则把身份对应关系落到了图像布局上。

此外,ID Representation Forcing会在图像合成之前,为每个身份单独训练一次预测。这样做的目的,是让模型在正式渲染前先形成对各个身份的表示,再进入最终生成阶段。两者结合后,身份信息不再完全依赖最终图像中的脸部相似度来校验。

结果与边界

在身份互斥的基准测试中,WithEveryone取得了最高的目标上下文身份相似度。材料给出的结果显示,其人脸相似度为0.499,高于GPT-Image-2的0.462;复制粘贴伪影则从0.169降至0.055。模型覆盖了97.3%的请求身份,重复率为2.8%。这些结果表明,显式的身份与布局绑定有助于把身份保持扩展到更大的群体,而不必依赖直接复制参考人脸。

我的判断

WithEveryone的价值在于把多人身份生成从单纯的相似度问题,转化为身份、区域和布局共同约束的问题。对于合照、群体角色和多参考人物生成,这种结构化规划具有明确意义。不过,现有材料只说明了身份互斥基准上的结果,尚不足以判断它在复杂遮挡、极端姿态或更开放的真实场景中是否同样稳定。最多十个身份也是论文明确给出的范围,不能据此推断模型可以无限扩展到更大群体。