几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026
与此同时,在 3D 视觉和场景生成中,一个长期问题是如何把局部生成结果组织成全局一致的 3D 世界。 现有视觉大模型在某些场景中仍可能出现跨视角结构不一致、物体数量或布局不合理等现象。
例如,当提示词中出现“卧室”时,模型有时会生成多张床;当虚拟相机在生成场景中进行较长距离漫游时,也可能出现建筑结构逐渐扭曲等问题。这些现象说明, 模型从数据中学到的局部先验非常强,但对全局 3D 结构的约束仍然不足。 引入显式的 3D 几何,可以为这些局部预测提供跨视角的结构约束,帮助构建更一致的全局结果。
在今年的欧洲计算机视觉国际会议(ECCV)上,香港科技大学教授谭平围绕这一问题介绍了团队近期在 3D 重建与 3D 场景生成方面的工作: 学习方法提供强大的局部先验,3D 几何则用于组织和约束这些预测,从而提升大规模场景中的全局一致性与可扩展性。
谭平师从国际 3D 视觉泰斗权龙教授,长期从事 3D 视觉研究。本次演讲延续了这一方向,重点讨论如何把学习方法的表达能力与多视图几何、全局优化等经典 3D 方法结合起来。
在演讲中,谭平教授将 3D 重建与 3D 场景生成放在同一框架下讨论:无论是从图像重建 3D 世界,还是生成可漫游的 3D 场景,学习模型已经能够提供非常强的局部先验;而要把这些局部结果组织成全局一致的 3D 表示,几何结构与全局优化仍然具有重要作用。
在重建任务中,前馈网络高效且鲁棒,但在大规模输入和高精度位姿估计上仍有计算与一致性问题;团队借鉴视觉 SLAM/SfM 的关键帧思想,并结合集束调整(Bundle Adjustment)进行全局优化。在生成任务中,则通过显式 3D 布局或 3D 代理(Proxy)提供结构约束,再利用生成模型补充外观与细节,从而改善大场景漫游时的空间一致性。
这场演讲想强调的并不是学习方法与几何方法的二选一,而是二者的互补性: 学习模型擅长从大规模数据中获得强大的局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。 对于空间计算、世界模型和具身智能,这种“学习先验 + 几何约束”的结合值得进一步探索。
今天我将分享我们近期在 3D 视觉和 3D 场景生成方面的工作。近年来,以 VGGSfM(或 DUSt3R 类前馈网络)为代表的基于大型 Transformer 的方法取得了很大进展。这类方法的基本思路非常直观:接收一组输入图像,提取特征,然后通过大型 Transformer 直接估计相机位姿、深度图和点云,并获得很强的局部 3D 重建效果。
大规模 SfM 方法:用“神经场景表示”
缓解 Transformer 的显存瓶颈
这一轻量化设计显著降低了全局建模时的显存开销,使方法能够扩展到更大规模的输入图像。
我们的方法能够处理更大规模的图像,并生成稠密、合理的 3D 点云与相机轨迹;与基线相比,因位姿不准导致的“重影”等伪影明显减少。在 Tanks and Temples 等复杂数据集的测试中,大约 70% 的情况下,相对旋转和相对平移误差都能控制在 5 度以内。
我还想分享一个关于“评估标准”的发现。过去,很多工作会把传统标杆算法 COLMAP 算出的相机位姿作为参考真值。但我们的研究也发现,COLMAP 本身存在估计误差,因此将其直接视为绝对真值也有一定局限。
为此,我们提取 90% 的输入图像,用我们的方法估计位姿并训练一个 NeRF 模型;最后在预留的 10% 未见视角上计算渲染图像的 PSNR(峰值信噪比)。结果显示,我们的方法在渲染质量和 PSNR 指标上优于以 COLMAP 位姿训练得到的结果。
至此,我们实现了前馈 3D 重建的规模化扩展。但在更大场景中,单纯依靠前馈预测仍可能出现误差累积和尺度不一致的问题。
于是我们提出第二个问题: 能否将神经网络前馈方法的鲁棒性和效率,与传统全局 SfM 优化的几何精度结合起来,使系统同时兼顾可扩展性与全局一致性?
给定输入图像,首先提取滑动窗口。在每个滑动窗口内,应用前馈神经网络(例如类似CroCo/RoMa匹配网络)计算图像对之间的相对运动和点云等信息;
接着,采用新方法在窗口内选择关键帧,并计算该关键帧与窗口内所有其他帧的匹配与对齐,从而获取一致的特征轨迹(feature track);
构建位姿图,依次进行旋转平均和平移平均,最后执行集束调整,生成最终的3D结果。
在相机位姿精度方面,ETH3D 数据集上 1 度阈值下的结果表明,本方法取得了很高的旋转精度,在多个场景测试中该指标可达到 100%。
首先是受 Text2Room 启发的两项研究。Text2Room 能根据文本生成 3D 房间,其思路是利用图像扩散模型逐步生成不同视角,最终拼接成全景图。不过,由于生成过程主要在局部视角上调用扩散模型,缺少显式的全局 3D 场景布局(scene layouts)约束,因此有时会出现家具数量或空间布局不合理的问题。
在布局生成环节,模型使用向量编码物体的坐标、尺寸和方向,并拼接为统一代码序列。基于该代码空间和真实结构化数据训练扩散模型,同时引入视觉先验以学习房间陈设的常见规律(如卧室通常包含床等家具)。此外,为改善外观渲染时全景图左右边界的衔接,我们在扩散过程中引入随机循环平移(random circular shift),显式增强循环一致性。对比测试表明,没有显式布局约束时可能出现一间卧室生成多张床等不合理结果,而布局引导有助于生成更合理的家具配置。
我们的第三项工作 SpatialCraft 进一步面向上述局限,采用两阶段策略。
第一阶段从单图生成 3D 代理(3D proxy)。通过在大量 3D 场景上训练的扩散模型,从单图推断出粗略的 3D 空间基底;在此基础上设置相机轨迹并渲染基础的 3D 漫游视频。第二阶段再引入视频扩散模型(video diffusion model),对基础视频进行 refinement,进一步提升纹理细节和视觉质量。
在第一阶段的技术细节中,核心是保持“像素对齐(pixel alignment)”以保留原始输入图像的特征。具体做法是将输入图像提升为深度图并转换为 3D 体素(voxels),利用网络补全场景中的不可见区域。这样可以让生成过程在可见区域与输入图像保持对齐,并为后续视角生成提供较稳定的 3D 结构;随后这些体素会被进一步处理为场景的 3D 高斯表示。
第二阶段则更侧重于“视频优化(video refinement)”。3D 代理已经提供了基础场景结构,可以对跨视角的空间关系形成约束;在此基础上,视频扩散模型重点优化画面的纹理细节和视觉质量。
实验结果表明,该方法不仅适用于室内场景,也能扩展到室外自然场景。即使相机进行较大范围移动,生成的漫游视频仍能较好保持空间一致性;在长视频生成测试中,相比现有基线,远离初始视角后仍能保持更稳定的场景结构。
总结而言,本次分享聚焦 3D 重建与 3D 场景生成两大方向。在 3D 重建中,深度学习前馈方法提供了强大的运动和结构先验,而多视图几何优化(如集束调整 BA)可以进一步提升全局精度与一致性。在 3D 场景生成中,现有大模型具备很强的局部生成能力,显式 3D 几何约束则有助于减少不合理结果,并支持更稳定的多视角与长距离生成。
因此,我更愿意 把 3D 几何理解为连接“重建”与“生成”的脚手架(scaffold):基于学习的大模型为我们提供强大的局部先验,而经典几何帮助把这些局部信息组织成全局一致的 3D 结构。
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群 !进群你会解锁这些「福利」 ?
会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。
中国公司牵头ECCV Workshop!多模态AI大牛轮番登台, ...
CVPR 2026 | VesMamba:3D肺部血管精确分割法
ECCV 2022 | 创新奇智提出通过单品示例进行基于原型 ...
ACL 2022奖项公布!达摩院、华为等机构获奖,陈丹琦 ...
ECCV:欧洲计算机视觉会议
TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
ECCV 2026 | 南航提出AgentVLN:让机器人导航进入Agent时代
不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026
TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
王田苗三问具身大牛:大模型还在「拨号上网」,机器人靠什么拿下真实订单?| WRC 2026
ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026
RSS 2026 实录:当 AGI 撞上「物理之墙」,想象力成为具身智能的第一生产力
星海图高继扬:具身智能的终极商业模式,是售卖「物理世界 Token」 | WRC 2026
李飞飞高徒黄文龙:具身智能需要一次「脑内搜索」革命 | RSS 2026
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026
AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型
3D 重建下半场开幕,ECCV 首场14篇Spotlight 把高斯泼溅推到了哪儿
浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026