单目深度估计需要从一张图像推断场景距离,本身存在多解性。尽管相关研究已较成熟,现有模型面对训练分布之外的输入时仍容易失效,生成的深度图也常缺少清晰边界。Marigold V2重新审视如何把现代图像生成与编辑模型中的扩散Transformer转化为密集视觉预测器,重点同时落在细节、泛化和推理成本上。
从多步生成转向单步回归
Marigold V2以预训练的多步流匹配模型为基础,但将目标改造成单步推理,并在需要时配合量化。论文强调,这套方案希望保留原模型容量,同时让运行成本保持在较低水平。这里的关键并非简单缩短采样流程:作者分析了直接训练产生的伪影,并提出两项补救措施,一是让模型内部表示与从真值中提取的语义特征对齐,二是采用围绕新型Sinkhorn损失构建的两阶段微调流程。两者共同改善深度结构和局部边缘,而不是只追求整体误差下降。
细节改善也延伸到其他密集任务
实验中,Marigold V2在KITTI和ETH3D上的AbsRel相对此前最佳结果提升16%至26%,并表现出较好的分布外泛化。定性结果尤其强调过去模型难以处理的细粒度区域,包括毛发、树叶以及头发般纤细的边缘,输出深度图更清晰、干净。该方法也被应用于表面法线估计和固有图像分解,并取得论文所称的当前最佳结果,说明这套训练方法并不只服务于深度估计。
我的判断
这项工作的实际价值,在于把生成模型的表示能力压缩进单步密集预测流程,并明确处理直接训练时出现的伪影问题。对场景重建、计算摄影等依赖清晰几何边界的应用,这比单纯改善平均指标更有意义。不过,材料只给出了KITTI和ETH3D上的相对提升,没有提供绝对误差、速度、显存占用或量化后的精度变化,因此尚不能判断其部署优势有多大。机器人等高风险场景还需要进一步验证时延稳定性、极端输入表现及深度尺度可靠性。