单图前馈式 3D Gaussian Splatting(3DGS)的吸引力,在于只凭一张图像直接生成可渲染的三维场景表示,绕开多视角采集与逐场景优化。InfiniSplat 关注的不是增加输入或恢复优化流程,而是重做高斯基元的放置与解码方式,以改善大幅视点移动时的结构连贯性。
像素对齐为何限制大基线合成
现有方法通常从固定图像网格位置预测高斯基元,也就是让表示与输入像素对齐。这种设计便于建立图像特征与高斯属性之间的对应关系,在邻近视角下也能得到不错的渲染结果,但基元位置与真实场景表面的耦合较弱。当视点发生较大变化时,固定网格的离散方式容易产生散落的基元,场景结构也更难保持一致。
InfiniSplat 因此把目标从“像素对齐”改为“表面对齐”:高斯基元不再天然依附于固定像素中心,而是尽量沿深度所反映的局部表面结构分布。这一变化针对的是表示层本身,而不是仅在渲染结果上追加修正。
几何采样与隐式解码如何配合
方法首先执行几何引导采样,依据深度诱导的局部表面结构放置二维支撑点;随后在这些支撑位置查询图像特征,并交给带查询条件的隐式解码器预测高斯属性。支撑点负责提供几何落点,解码器负责从对应图像特征生成基元,两者共同解除高斯预测对固定像素中心的绑定。
按摘要表述,InfiniSplat 在多项跨数据集新视角合成评测中,相比单图前馈基线取得了当前最佳表现,并展示了从 Hypersim 室内合成数据训练出发的零样本泛化。不过,给定材料没有完整列出目标场景、具体指标、提升幅度、消融实验或计算开销,因此还不能判断收益主要来自采样策略、隐式解码器,还是两者组合。
我的判断
这项工作的价值在于抓住了单图 3DGS 的一个表示瓶颈:固定像素网格适合读取图像,却未必适合承载三维表面。将几何落点与属性预测解耦,是一个具体且有针对性的改动,尤其适合关注大视角变化的新视角合成任务。但论文摘要中的比较范围是单图前馈基线,不能据此推断它优于多视角输入或逐场景优化方案。缺少定量结果与效率信息时,更稳妥的结论是:表面对齐值得关注,但实际质量、速度和泛化边界仍需完整实验确认。