人物—物体中心的视频个性化,是主体驱动视频生成中的核心任务。现有方案往往难以同时保持人物与物体的外观一致性,并准确生成二者的互动;当物体是 logo 等抽象概念时,这一矛盾更加明显。HOMIE试图把跨主体与主体内参考纳入同一框架,重点不是增加一种参考形式,而是让模型理解参考之间的关系。
两类参考为何难以统一
在跨主体个性化场景中,模型既要忠实还原不同主体,又要遵循文本指定的人物—物体互动模式,两项目标容易相互牵制。主体内参考则提供同一主体的补充信息,例如 OCR 映射图或多视角图像,但这些输入之间存在隐含对应关系,单纯把它们作为额外图像送入模型,并不意味着模型能够正确利用。
HOMIE将两种输入设置统一处理:前者关注不同主体之间的组合和互动,后者关注同一主体的多份参考如何互相补充。这使方案能够面向多种人物—物体视频定制任务,而不必为每类参考单独设计流程。
用多模态语义连接参考与视频表示
HOMIE的关键是调整多模态大语言模型的接入方式。论文没有让其替代文本编码器的控制作用,也避免进行成本较高的重新对齐,而是利用多模态模型提取参考级关系知识。
具体来说,框架在自注意力中加入全局多模态引导,使多模态模型产生的语义特征更好地对齐 VAE token。与此同时,模态—参考嵌入用于区分多模态特征与 VAE token,并关联来自主体内参考图像的 token。前者解决不同表示空间如何协作,后者负责标记信息来源及参考归属。作者称,大量实验显示该方法在多类 HOCVP 任务上达到当前最佳表现。
我的判断
HOMIE的价值在于把问题从“输入更多参考图”推进到“显式建模参考关系”,尤其适合同时要求主体保真、物体识别和互动准确的视频定制场景。其设计也较克制:多模态模型主要提供关系语义,而文本编码器仍保留控制职责。
不过,摘要没有给出具体数据集、指标、提升幅度、计算成本或消融结果,因此暂时无法判断优势主要来自关系建模、额外语义能力还是整体训练配置。对长视频一致性、复杂动作以及未见类别的泛化能力,也不能据此作出结论。现阶段更适合把它视为一种值得验证的多参考融合架构,而不是已经解决人物—物体视频个性化的通用方案。