2026-07-21 · 3D重建 · 前馈模型 · 生成先验
三维重建是计算机视觉的核心任务之一。它的目标很简单:从二维图像中恢复三维世界。
但这个问题背后隐藏着一个更深的哲学分歧:重建到底是"恢复已有",还是"推断缺失"?
传统方法认为:重建就是恢复。相机拍到了什么,就还原什么。没拍到的部分?那是未知的,不应该瞎猜。
但新一代研究者说:重建应该是推断。你没拍到的部分,我可以"想象"出来——而且想象得还挺准。
这就是生成式重建(Generative Reconstruction)的故事。它不是渐进式的改进,而是一次根本性的范式转变。
2006 年,Noah Snavely 等人在 SIGGRAPH 上发表了一篇开创性论文——Photo Tourism。他们从 Flickr 上收集了大量游客照片,通过多视图几何约束,重建出了罗马斗兽场、巴黎圣母院等著名景点的三维模型。
这就是 SfM(Structure-from-Motion)的核心思想:从多张照片中恢复相机位姿和稀疏点云。
随后,MVS(Multi-View Stereo)进一步 densify 了点云——从稀疏的几千个点变成密集的几百万个点。
这套方法统治了三维重建领域十几年。但它有一个根本性的局限:逐场景优化。
每个场景都需要独立的优化过程,耗时从分钟到小时不等。而且它只能"恢复已有"——如果某个角度没拍到,那就是空洞,模型不会帮你"脑补"。
2020 年,一个叫做 NeRF(Neural Radiance Fields) 的工作横空出世 [1]。
NeRF 的核心思想很优雅:用一个神经网络表示整个场景。输入一个三维坐标和观察方向,输出颜色和密度。
MLP(x, y, z, θ, ϕ) → (颜色, 密度)
然后通过可微渲染,让这个网络"学会"从 2D 图像中恢复 3D 场景。
效果是惊人的:NeRF 能生成照片级真实感的新视角合成。你从没见过这个角度,但它能"画"出来,而且看起来完全真实。
但 NeRF 继承了 SfM/MVS 的致命缺陷:逐场景优化。每个场景都要重新训练一个网络,耗时几十分钟到几小时。它不能"举一反三"——训练时没见过的新场景,它无能为力。
2021 年,Alex Yu 等人提出了 PixelNeRF [13]——第一个"前馈"NeRF 方法。
它的思路是:不再为每个场景单独训练一个网络,而是学习一个通用的映射函数。输入图像,直接输出 NeRF 参数。
这意味着:训练一次,推理时只需要一次前向传播(几秒钟),就能重建新场景。
但 PixelNeRF 的性能有限——它只能处理简单的物体,复杂场景效果不佳。
2023 年,Meta FAIR 的 Shuzhe Wang 等人发布了一个大胆的工作——DUSt3R [3]。
DUSt3R 的核心洞察是:与其预测复杂的 NeRF 或 3DGS,不如直接预测每个像素的三维坐标。
图像 → 网络 → 每个像素的 (x, y, z) 坐标
就这么简单。没有复杂的 3D 表示,没有耗时的优化。输入图像,输出点云。
更惊人的是:DUSt3R 同时预测相机位姿。你给它两张照片,它不仅能重建三维场景,还能告诉你相机在哪里、朝哪个方向。
DUSt3R 的意义在于:它证明了前馈重建可以比传统方法更快、更简单,而且效果相当。
2023 年,另一个工作彻底改变了 3D 表示的格局——3D Gaussian Splatting(3DGS) [2]。
3DGS 的核心思想是:用几百万个各向异性的三维高斯椭球表示场景。每个高斯有位置、形状、颜色、不透明度。
相比 NeRF 的隐式表示(MLP),3DGS 是显式的——你可以直接看到、编辑、操作这些高斯。
更重要的是:3DGS 支持实时渲染。NeRF 渲染一帧需要几秒,3DGS 只需要几毫秒。
很快,研究者开始把 3DGS 和前馈重建结合:
现在,前馈重建有了两条路线:
2024 年,研究者开始把"前馈"思想推向更大规模。一个标志性的工作是 LRM(Large Reconstruction Model) [14]。
LRM 的核心思想很直接:既然 LLM 可以处理语言,ViT 可以处理图像,那为什么不能用一个大型 Transformer 直接处理 3D 重建?
LRM 的架构很简单:
输入图像 → ViT 编码器 → Transformer 解码器 → NeRF 参数
5 亿参数,在 100 万个 3D 对象上训练(来自 Objaverse 和 MVImgNet)。结果:输入一张图像,5 秒内输出完整的 NeRF 模型。
LRM 的意义在于:它证明了 3D 重建也可以走"大模型"路线。训练一次,推理时不需要逐场景优化,几秒钟就能重建新场景。而且由于训练数据足够大,LRM 能泛化到各种未见过的物体——包括真实世界的照片和生成模型合成的图像。
几乎同时,LVSM(Large View Synthesis Model) [16] 提出了一个更激进的方案。
LVSM 的核心洞察是:与其让模型学习复杂的 3D 表示(NeRF、3DGS),不如直接学习视图之间的映射关系。
它的架构是一个纯 Transformer:
输入视图(图像 + 位姿)→ Transformer → 输出视图(新角度的图像)
没有显式的 3D 表示,没有可微渲染。模型直接从数据中学习"从这个角度看,那个角度应该是什么样"。
这种做法的好处是:极简,可扩展。不需要设计复杂的 3D 表示,只需要堆 Transformer 层、加数据。LVSM 在多个基准上达到了 state-of-the-art,而且可以处理任意数量的输入视图。
LRM 和 LVSM 代表了两种不同的哲学:
哪种更好?目前没有定论。但它们共同说明了一个趋势:前馈重建正在走向大规模、通用化。
2025 年,Matrix3D [18] 进一步把这个思路推向了极致。它的核心洞察是:位姿估计、深度预测、新视角合成,这些任务本质上是相关的。
Matrix3D 的架构是一个统一的 Transformer:
输入图像 → Transformer 编码器 → 多任务解码头
├─ 相机位姿
├─ 深度图
└─ 新视角图像
一个模型,同时做三件事。而且由于任务之间共享特征,Matrix3D 在每个任务上的表现都不输专门针对该任务训练的模型。
Matrix3D 的意义在于:它证明了 3D 重建也可以走"多任务统一"路线。不需要为每个任务单独训练一个模型,一个大模型可以同时处理多个相关任务。
LRM、LVSM、Matrix3D,这三个工作代表了前馈重建的三个方向:
它们共同说明了一个趋势:前馈重建正在走向大规模、通用化、多任务化。
前馈重建解决了"速度"问题,但遇到了新挑战:稀疏输入。
如果你只有一张图像,或者视角很稀疏,前馈方法的效果会急剧下降。因为它只能"看到什么重建什么"——没看到的部分,就是空洞。
这时候,一个关键洞察出现了:生成模型(尤其是扩散模型)已经学会了丰富的视觉先验。能不能把这些先验"注入"到重建中?
2024 年,研究者提出了 MVSplat360 [178]——第一个把扩散模型和前馈 3DGS 结合的工作。
它的思路是:先用前馈方法预测初始的 3DGS,然后用 Stable Video Diffusion 模型"细化"渲染结果。
扩散模型的作用是:"脑补"缺失的部分。如果你只看到物体的正面,扩散模型能根据它学到的先验,"想象"出背面应该是什么样子。
同年,LatentSplat [180] 提出了一个更优雅的方案:在潜空间中预测语义高斯。
传统前馈方法直接在像素空间预测高斯参数。LatentSplat 的做法是:先在3D 潜空间中预测语义高斯,然后用一个轻量级的 2D 生成架构解码渲染。
这样做的好处是:潜空间更紧凑,能捕捉更丰富的语义信息;而且可以用预训练的 2D 生成模型(如扩散模型)作为解码器,注入强大的视觉先验。
相比直接在像素空间预测,LatentSplat 能更好地处理稀疏视角——因为它学到的不是"这个像素是什么颜色",而是"这个区域有什么语义概念"。
2025 年,两个独立的工作几乎同时提出了同一个想法:用单步扩散模型做后处理增强。
Difix3D+ [179] 来自 NVIDIA / Meta 团队。它的核心是一个叫 Difix 的单步图像扩散模型——输入一张有伪影的渲染图,一步去噪,输出干净的结果。把它插入到任何前馈 3DGS 流程的末端,就能"修复"新视角渲染中的模糊和伪影。
ProSplat [183] 则更专注于宽基线稀疏视角场景。它也是一个两阶段框架:先预测 3DGS,再用单步扩散模型细化。但它额外引入了对极约束注意力(DWEA)和最大重叠参考视图注入(MORI),确保扩散细化不会破坏多视图几何一致性。
两者的共同洞察是:多步扩散模型太慢(不适合实时渲染),但单步扩散模型足够快,而且已经学到了足够强的视觉先验——足以"修复"前馈方法的输出。
2025 年,Meta FAIR 发布了 VGGT(Visual Geometry Grounded Transformer) [19]——一个试图统一多种 3D 任务的基础模型。
VGGT 的野心很大:它不仅要重建 3D 场景,还要同时做:
通过多任务预训练,VGGT 学习了一个丰富的"视觉-几何"特征空间。它在各个任务上都达到了 state-of-the-art,而且可以泛化到未见过的场景。
VGGT 的意义在于:它证明了3D 视觉也可以走"基础模型"路线——一个大模型,解决多个任务,而不是为每个任务单独训练一个小模型。
VGGT 虽然强大,但推理速度慢(需要处理大量 token)。很快,一系列优化工作出现:
这些优化让 VGGT 从"实验室玩具"变成了"可用工具"。
真实世界是动态的。人在走动,车在行驶,树叶在飘动。静态重建无法捕捉这些变化。
2024-2025 年,研究者开始把前馈重建扩展到动态 4D 场景。
StreamSplat [182] 的思路是:逐帧处理视频,增量更新 3DGS。
每处理一帧,它不仅更新高斯的位置和颜色,还预测每个高斯的速度——这样就能"跟踪"运动的物体。
L4GM [186] 走了另一条路线:大型 4D 重建模型。
它基于 LGM(Large Gaussian Model,大型 3D 高斯重建模型)扩展到时间维度:输入一段视频,一次性预测每一帧的 3DGS,然后用时间插值模型上采样到更高帧率。
L4GM 的关键创新是:在 LGM 的基础上加入时间自注意力层,让模型学习跨帧的一致性。训练数据是 1200 万个渲染视频(来自 Objaverse 的 4.4 万个动画对象)。
相比流式处理,L4GM 能更好地保证时序一致性——因为它能看到整个视频,而不是只看当前帧。
生成式重建发展迅速,但仍有很多开放问题:
目前的前馈方法大多在室内场景(ScanNet、Replica)或简单物体上训练。当部署到复杂的户外场景(城市街道、森林)时,效果会急剧下降。
原因很简单:训练数据和测试数据的分布差距太大。模型"见过"的室内场景,和"没见过"的户外场景,差异太大。
生成式重建的核心优势是"脑补"缺失部分。但这带来了一个风险:幻觉可能不可靠。
在自动驾驶、机器人等安全关键应用中,这种错误可能是致命的。
目前的 3D 重建主要是"视觉"的——看起来真实,但不能"交互"。
如果你让机器人去抓一个重建出来的杯子,它可能会失败——因为重建的杯子没有物理属性(质量、摩擦力、刚度)。
一个新兴方向是:物理感知重建。不仅重建外观,还重建物理属性。代表工作:
这些方法让重建出来的 3D 场景不仅能"看",还能"用"——机器人可以基于物理属性做抓取规划,游戏引擎可以模拟真实的物理交互。
如果把三维重建比作"画画",那么:
传统方法(SfM/MVS)是"写生"。 你看到什么,就画什么。没看到的部分,留白。
NeRF 是"照片级写实画"。 你能画出从未见过的角度,但每幅画都要花几个小时。
前馈重建是"速写"。 几秒钟就能画完,但细节不够。
生成式重建是"有想象力的速写"。 不仅画得快,还能"脑补"出没看到的部分——而且想象得还挺准。
从"恢复已有"到"推断缺失",从"逐场景优化"到"一次前向传播",从"几何重建"到"生成式重建"——这是三维重建领域的范式转变。
而这场变革的参与者——Meta FAIR 的 DUSt3R、3DGS 的发明者、扩散模型的研究者——每一个人都在试图回答同一个问题:
机器能否像人类一样,从有限的观察中"想象"出完整的世界?
答案正在越来越近。
[1] Mildenhall, B., et al. "NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis." ECCV 2020. arXiv:2003.08934
[2] Kerbl, B., et al. "3D Gaussian Splatting for Real-Time Radiance Field Rendering." SIGGRAPH 2023. arXiv:2308.04079
[3] Wang, S., et al. "DUSt3R: Geometric 3D Vision Made Easy." CVPR 2024. arXiv:2312.14132
[13] Yu, A., et al. "pixelNeRF: Neural Radiance Fields from One or Few Images." CVPR 2021. arXiv:2012.02190
[15] Charatan, D., et al. "pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable Novel View Synthesis." CVPR 2024. arXiv:2312.12337
[14] Hong, Y., et al. "LRM: Large Reconstruction Model for Single Image to 3D." ICLR 2024. arXiv:2311.04400
[16] Jin, H., et al. "LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias." arXiv 2024. arXiv:2410.22761
[17] Chen, C., et al. "MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images." ECCV 2024. arXiv:2403.14627
[18] Lu, Y., et al. "Matrix3D: Large Photogrammetry Model All-in-One." CVPR 2025.
[19] Wang, S., et al. "VGGT: Visual Geometry Grounded Transformer." CVPR 2025.
[178] Chen, Y., et al. "MVSplat360: Feed-Forward 360 Scene Synthesis from Sparse Views." NeurIPS 2024. arXiv:2411.04924
[179] Wu, J. Z., et al. "Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models." arXiv 2025. arXiv:2503.09585
[180] Wewer, C., et al. "latentSplat: Autoencoding Variational Gaussians for Fast Generalizable 3D Reconstruction." arXiv 2024. arXiv:2403.16292
[182] Wu, Z., et al. "StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams." ICLR 2026. arXiv:2506.08862
[183] Lu, X., et al. "ProSplat: Improved Feed-Forward 3D Gaussian Splatting for Wide-Baseline Sparse Views." arXiv 2025. arXiv:2506.07670
[186] Ren, J., et al. "L4GM: Large 4D Gaussian Reconstruction Model." arXiv 2024. arXiv:2406.10324
[197] Le, L., et al. "PIXIE: Fast and Generalizable Supervised Learning of 3D Physics from Pixels." arXiv 2025. arXiv:2508.17437
[198] Lv, C., et al. "PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis." CVPR 2026. arXiv:2508.13911
最后更新:2026-07-21 · 将持续更新