生成式重建:从几何恢复到内容生成

2026-07-21 · 3D重建 · 前馈模型 · 生成先验

序章:一个根本问题

三维重建是计算机视觉的核心任务之一。它的目标很简单:从二维图像中恢复三维世界

但这个问题背后隐藏着一个更深的哲学分歧:重建到底是"恢复已有",还是"推断缺失"?

传统方法认为:重建就是恢复。相机拍到了什么,就还原什么。没拍到的部分?那是未知的,不应该瞎猜。

但新一代研究者说:重建应该是推断。你没拍到的部分,我可以"想象"出来——而且想象得还挺准。

这就是生成式重建(Generative Reconstruction)的故事。它不是渐进式的改进,而是一次根本性的范式转变。


第一章:传统重建的困境(2006-2022)

SfM 和 MVS:几何派的黄金时代

2006 年,Noah Snavely 等人在 SIGGRAPH 上发表了一篇开创性论文——Photo Tourism。他们从 Flickr 上收集了大量游客照片,通过多视图几何约束,重建出了罗马斗兽场、巴黎圣母院等著名景点的三维模型。

这就是 SfM(Structure-from-Motion)的核心思想:从多张照片中恢复相机位姿和稀疏点云。

随后,MVS(Multi-View Stereo)进一步 densify 了点云——从稀疏的几千个点变成密集的几百万个点。

想象你站在埃菲尔铁塔前,用相机拍了 100 张照片。SfM 能从这些照片中找到几千个特征点,恢复出相机在哪里、铁塔的大致形状。MVS 则能把这些点变密,生成一个看起来像铁塔的三维模型。

这套方法统治了三维重建领域十几年。但它有一个根本性的局限:逐场景优化

每个场景都需要独立的优化过程,耗时从分钟到小时不等。而且它只能"恢复已有"——如果某个角度没拍到,那就是空洞,模型不会帮你"脑补"。

NeRF:神经渲染的革命

2020 年,一个叫做 NeRF(Neural Radiance Fields) 的工作横空出世 [1]。

NeRF 的核心思想很优雅:用一个神经网络表示整个场景。输入一个三维坐标和观察方向,输出颜色和密度。

MLP(x, y, z, θ, ϕ) → (颜色, 密度)

然后通过可微渲染,让这个网络"学会"从 2D 图像中恢复 3D 场景。

效果是惊人的:NeRF 能生成照片级真实感的新视角合成。你从没见过这个角度,但它能"画"出来,而且看起来完全真实。

但 NeRF 继承了 SfM/MVS 的致命缺陷:逐场景优化。每个场景都要重新训练一个网络,耗时几十分钟到几小时。它不能"举一反三"——训练时没见过的新场景,它无能为力。


第二章:前馈重建的革命(2021-2024)

PixelNeRF:第一次尝试

2021 年,Alex Yu 等人提出了 PixelNeRF [13]——第一个"前馈"NeRF 方法。

它的思路是:不再为每个场景单独训练一个网络,而是学习一个通用的映射函数。输入图像,直接输出 NeRF 参数。

这意味着:训练一次,推理时只需要一次前向传播(几秒钟),就能重建新场景。

但 PixelNeRF 的性能有限——它只能处理简单的物体,复杂场景效果不佳。

DUSt3R:几何派的反击

2023 年,Meta FAIR 的 Shuzhe Wang 等人发布了一个大胆的工作——DUSt3R [3]。

DUSt3R 的核心洞察是:与其预测复杂的 NeRF 或 3DGS,不如直接预测每个像素的三维坐标

图像 → 网络 → 每个像素的 (x, y, z) 坐标

就这么简单。没有复杂的 3D 表示,没有耗时的优化。输入图像,输出点云。

更惊人的是:DUSt3R 同时预测相机位姿。你给它两张照片,它不仅能重建三维场景,还能告诉你相机在哪里、朝哪个方向。

传统方法需要:先跑 SfM 恢复位姿 → 再跑 MVS 生成点云 → 再跑网格重建。DUSt3R 一步到位:输入图像,输出点云 + 位姿。端到端,几秒钟。

DUSt3R 的意义在于:它证明了前馈重建可以比传统方法更快、更简单,而且效果相当

3DGS:渲染派的逆袭

2023 年,另一个工作彻底改变了 3D 表示的格局——3D Gaussian Splatting(3DGS) [2]。

3DGS 的核心思想是:用几百万个各向异性的三维高斯椭球表示场景。每个高斯有位置、形状、颜色、不透明度。

相比 NeRF 的隐式表示(MLP),3DGS 是显式的——你可以直接看到、编辑、操作这些高斯。

更重要的是:3DGS 支持实时渲染。NeRF 渲染一帧需要几秒,3DGS 只需要几毫秒。

很快,研究者开始把 3DGS 和前馈重建结合:

现在,前馈重建有了两条路线:

大规模前馈模型:LRM、LVSM 与 Matrix3D

2024 年,研究者开始把"前馈"思想推向更大规模。一个标志性的工作是 LRM(Large Reconstruction Model) [14]。

LRM 的核心思想很直接:既然 LLM 可以处理语言,ViT 可以处理图像,那为什么不能用一个大型 Transformer 直接处理 3D 重建?

LRM 的架构很简单:

输入图像 → ViT 编码器 → Transformer 解码器 → NeRF 参数

5 亿参数,在 100 万个 3D 对象上训练(来自 Objaverse 和 MVImgNet)。结果:输入一张图像,5 秒内输出完整的 NeRF 模型。

LRM 的意义在于:它证明了 3D 重建也可以走"大模型"路线。训练一次,推理时不需要逐场景优化,几秒钟就能重建新场景。而且由于训练数据足够大,LRM 能泛化到各种未见过的物体——包括真实世界的照片和生成模型合成的图像。

几乎同时,LVSM(Large View Synthesis Model) [16] 提出了一个更激进的方案。

LVSM 的核心洞察是:与其让模型学习复杂的 3D 表示(NeRF、3DGS),不如直接学习视图之间的映射关系

它的架构是一个纯 Transformer:

输入视图(图像 + 位姿)→ Transformer → 输出视图(新角度的图像)

没有显式的 3D 表示,没有可微渲染。模型直接从数据中学习"从这个角度看,那个角度应该是什么样"。

这种做法的好处是:极简,可扩展。不需要设计复杂的 3D 表示,只需要堆 Transformer 层、加数据。LVSM 在多个基准上达到了 state-of-the-art,而且可以处理任意数量的输入视图。

LRM 和 LVSM 代表了两种不同的哲学:

哪种更好?目前没有定论。但它们共同说明了一个趋势:前馈重建正在走向大规模、通用化

2025 年,Matrix3D [18] 进一步把这个思路推向了极致。它的核心洞察是:位姿估计、深度预测、新视角合成,这些任务本质上是相关的

Matrix3D 的架构是一个统一的 Transformer:

输入图像 → Transformer 编码器 → 多任务解码头
                                    ├─ 相机位姿
                                    ├─ 深度图
                                    └─ 新视角图像

一个模型,同时做三件事。而且由于任务之间共享特征,Matrix3D 在每个任务上的表现都不输专门针对该任务训练的模型。

Matrix3D 的意义在于:它证明了 3D 重建也可以走"多任务统一"路线。不需要为每个任务单独训练一个模型,一个大模型可以同时处理多个相关任务。

LRM、LVSM、Matrix3D,这三个工作代表了前馈重建的三个方向:

它们共同说明了一个趋势:前馈重建正在走向大规模、通用化、多任务化


第三章:生成先验的注入(2024-2025)

前馈重建解决了"速度"问题,但遇到了新挑战:稀疏输入

如果你只有一张图像,或者视角很稀疏,前馈方法的效果会急剧下降。因为它只能"看到什么重建什么"——没看到的部分,就是空洞。

这时候,一个关键洞察出现了:生成模型(尤其是扩散模型)已经学会了丰富的视觉先验。能不能把这些先验"注入"到重建中?

MVSplat360:扩散先验的第一次尝试

2024 年,研究者提出了 MVSplat360 [178]——第一个把扩散模型和前馈 3DGS 结合的工作。

它的思路是:先用前馈方法预测初始的 3DGS,然后用 Stable Video Diffusion 模型"细化"渲染结果。

扩散模型的作用是:"脑补"缺失的部分。如果你只看到物体的正面,扩散模型能根据它学到的先验,"想象"出背面应该是什么样子。

你给 MVSplat360 一张椅子的正面照片。前馈方法只能重建正面。但扩散模型"知道"椅子有四条腿、有靠背。它能"幻觉"出背面和侧面,生成一个完整的 3D 椅子。

LatentSplat:潜空间中的语义高斯

同年,LatentSplat [180] 提出了一个更优雅的方案:在潜空间中预测语义高斯

传统前馈方法直接在像素空间预测高斯参数。LatentSplat 的做法是:先在3D 潜空间中预测语义高斯,然后用一个轻量级的 2D 生成架构解码渲染。

这样做的好处是:潜空间更紧凑,能捕捉更丰富的语义信息;而且可以用预训练的 2D 生成模型(如扩散模型)作为解码器,注入强大的视觉先验。

相比直接在像素空间预测,LatentSplat 能更好地处理稀疏视角——因为它学到的不是"这个像素是什么颜色",而是"这个区域有什么语义概念"。

Difix3D+ 与 ProSplat:单步扩散细化的两条路线

2025 年,两个独立的工作几乎同时提出了同一个想法:用单步扩散模型做后处理增强

Difix3D+ [179] 来自 NVIDIA / Meta 团队。它的核心是一个叫 Difix 的单步图像扩散模型——输入一张有伪影的渲染图,一步去噪,输出干净的结果。把它插入到任何前馈 3DGS 流程的末端,就能"修复"新视角渲染中的模糊和伪影。

ProSplat [183] 则更专注于宽基线稀疏视角场景。它也是一个两阶段框架:先预测 3DGS,再用单步扩散模型细化。但它额外引入了对极约束注意力(DWEA)和最大重叠参考视图注入(MORI),确保扩散细化不会破坏多视图几何一致性。

两者的共同洞察是:多步扩散模型太慢(不适合实时渲染),但单步扩散模型足够快,而且已经学到了足够强的视觉先验——足以"修复"前馈方法的输出。


第四章:走向基础模型(2025)

VGGT:统一的尝试

2025 年,Meta FAIR 发布了 VGGT(Visual Geometry Grounded Transformer) [19]——一个试图统一多种 3D 任务的基础模型。

VGGT 的野心很大:它不仅要重建 3D 场景,还要同时做:

通过多任务预训练,VGGT 学习了一个丰富的"视觉-几何"特征空间。它在各个任务上都达到了 state-of-the-art,而且可以泛化到未见过的场景。

VGGT 的意义在于:它证明了3D 视觉也可以走"基础模型"路线——一个大模型,解决多个任务,而不是为每个任务单独训练一个小模型。

VGGT 家族的优化

VGGT 虽然强大,但推理速度慢(需要处理大量 token)。很快,一系列优化工作出现:

这些优化让 VGGT 从"实验室玩具"变成了"可用工具"。


第五章:动态世界的挑战

真实世界是动态的。人在走动,车在行驶,树叶在飘动。静态重建无法捕捉这些变化。

2024-2025 年,研究者开始把前馈重建扩展到动态 4D 场景

StreamSplat:在线流式处理

StreamSplat [182] 的思路是:逐帧处理视频,增量更新 3DGS。

每处理一帧,它不仅更新高斯的位置和颜色,还预测每个高斯的速度——这样就能"跟踪"运动的物体。

你给 StreamSplat 一段行人在街上走动的视频。它逐帧处理,实时更新场景。行人移动时,对应的高斯也跟着移动——而不是在每一帧都重新生成。

L4GM:大型 4D 高斯重建模型

L4GM [186] 走了另一条路线:大型 4D 重建模型

它基于 LGM(Large Gaussian Model,大型 3D 高斯重建模型)扩展到时间维度:输入一段视频,一次性预测每一帧的 3DGS,然后用时间插值模型上采样到更高帧率。

L4GM 的关键创新是:在 LGM 的基础上加入时间自注意力层,让模型学习跨帧的一致性。训练数据是 1200 万个渲染视频(来自 Objaverse 的 4.4 万个动画对象)。

相比流式处理,L4GM 能更好地保证时序一致性——因为它能看到整个视频,而不是只看当前帧。


第六章:那些还没解决的问题

生成式重建发展迅速,但仍有很多开放问题:

泛化的天花板

目前的前馈方法大多在室内场景(ScanNet、Replica)或简单物体上训练。当部署到复杂的户外场景(城市街道、森林)时,效果会急剧下降。

原因很简单:训练数据和测试数据的分布差距太大。模型"见过"的室内场景,和"没见过"的户外场景,差异太大。

"幻觉"的可靠性

生成式重建的核心优势是"脑补"缺失部分。但这带来了一个风险:幻觉可能不可靠

你给模型一张汽车的照片,让它"脑补"出背面。如果训练数据里大多是轿车,它可能会生成一个轿车的背面。但如果实际是一辆 SUV,幻觉就错了。

在自动驾驶、机器人等安全关键应用中,这种错误可能是致命的。

物理可交互性

目前的 3D 重建主要是"视觉"的——看起来真实,但不能"交互"。

如果你让机器人去抓一个重建出来的杯子,它可能会失败——因为重建的杯子没有物理属性(质量、摩擦力、刚度)。

一个新兴方向是:物理感知重建。不仅重建外观,还重建物理属性。代表工作:

这些方法让重建出来的 3D 场景不仅能"看",还能"用"——机器人可以基于物理属性做抓取规划,游戏引擎可以模拟真实的物理交互。


尾声:一个隐喻

如果把三维重建比作"画画",那么:

传统方法(SfM/MVS)是"写生"。 你看到什么,就画什么。没看到的部分,留白。

NeRF 是"照片级写实画"。 你能画出从未见过的角度,但每幅画都要花几个小时。

前馈重建是"速写"。 几秒钟就能画完,但细节不够。

生成式重建是"有想象力的速写"。 不仅画得快,还能"脑补"出没看到的部分——而且想象得还挺准。

从"恢复已有"到"推断缺失",从"逐场景优化"到"一次前向传播",从"几何重建"到"生成式重建"——这是三维重建领域的范式转变。

而这场变革的参与者——Meta FAIR 的 DUSt3R、3DGS 的发明者、扩散模型的研究者——每一个人都在试图回答同一个问题:

机器能否像人类一样,从有限的观察中"想象"出完整的世界?

答案正在越来越近。


参考文献

[1] Mildenhall, B., et al. "NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis." ECCV 2020. arXiv:2003.08934

[2] Kerbl, B., et al. "3D Gaussian Splatting for Real-Time Radiance Field Rendering." SIGGRAPH 2023. arXiv:2308.04079

[3] Wang, S., et al. "DUSt3R: Geometric 3D Vision Made Easy." CVPR 2024. arXiv:2312.14132

[13] Yu, A., et al. "pixelNeRF: Neural Radiance Fields from One or Few Images." CVPR 2021. arXiv:2012.02190

[15] Charatan, D., et al. "pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable Novel View Synthesis." CVPR 2024. arXiv:2312.12337

[14] Hong, Y., et al. "LRM: Large Reconstruction Model for Single Image to 3D." ICLR 2024. arXiv:2311.04400

[16] Jin, H., et al. "LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias." arXiv 2024. arXiv:2410.22761

[17] Chen, C., et al. "MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images." ECCV 2024. arXiv:2403.14627

[18] Lu, Y., et al. "Matrix3D: Large Photogrammetry Model All-in-One." CVPR 2025.

[19] Wang, S., et al. "VGGT: Visual Geometry Grounded Transformer." CVPR 2025.

[178] Chen, Y., et al. "MVSplat360: Feed-Forward 360 Scene Synthesis from Sparse Views." NeurIPS 2024. arXiv:2411.04924

[179] Wu, J. Z., et al. "Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models." arXiv 2025. arXiv:2503.09585

[180] Wewer, C., et al. "latentSplat: Autoencoding Variational Gaussians for Fast Generalizable 3D Reconstruction." arXiv 2024. arXiv:2403.16292

[182] Wu, Z., et al. "StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams." ICLR 2026. arXiv:2506.08862

[183] Lu, X., et al. "ProSplat: Improved Feed-Forward 3D Gaussian Splatting for Wide-Baseline Sparse Views." arXiv 2025. arXiv:2506.07670

[186] Ren, J., et al. "L4GM: Large 4D Gaussian Reconstruction Model." arXiv 2024. arXiv:2406.10324

[197] Le, L., et al. "PIXIE: Fast and Generalizable Supervised Learning of 3D Physics from Pixels." arXiv 2025. arXiv:2508.17437

[198] Lv, C., et al. "PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis." CVPR 2026. arXiv:2508.13911


最后更新:2026-07-21 · 将持续更新