AI 日报hiw3c.com

世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!

量子位 www.qbitai.com 网页快照

世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!

桌上的碗是可以单独拎起来的,椅子是可以旋转挪动的,不喜欢的家具也是可以随时随地替换的……

踏出这一步的,正是3D生成头部玩家 影眸Hyper3D ,其正式发布世界生成模型 WorldGen ,把3D生成从单个资产推向完整场景。

不是生成一个只能观看的世界,而是交付 可交互 、 可编辑 、 可进入真实生产环境 的3D场景。

就像拼乐高积木,既能往里面持续加模块,也能随时抽出、替换其中任意一块;每一块还自带物理属性,如果不小心抽走关键支撑物,周围的物体同样会发生位移或跌落。

游戏需要关卡,影视需要片场,机器人需要训练环境……但它们现在都可以从WorldGen开始,其生成能力已经足以跑进真实生产场景。

这条路也不是凭空造出来的,早在去年,影眸Hyper3D就凭借自研的场景级生成技术 CAST 拿下国际图形学顶会 SIGGRAPH 2025最佳论文 。

所以如果说AI 3D的第一步是回答物体长什么样,那么WorldGen回答的则是第二个问题:

一张图→一组资产→一个场景

用户在场景内能做到的相当有限,基本就是走走看看。想改动?不好意思,只能推翻重来。

传统做法直接将整个场景作为一个模型生成,所有内容容易被合并成不可拆解的整体,场景很难继续使用。 WorldGen的关键变化,是 把场景拆解为可单独操作的资产 ,同时保留它们之间的空间与物理关系。

打开官网 (https://hyper3d.ai) ,选择WorldGen生成。

背景环境则用 3D Gaussian Splatting 补全,兼顾视觉完整性。整体可压缩至2到3分钟。

打开 SimReady模式 后,系统还会为每件资产补充碰撞体,并估计质量、摩擦系数、恢复系数等仿真所需的物理属性。

真实采集不仅要承担场地、设备和人员成本,火灾、坍塌等危险环境也无法被安全复现;传统仿真虽然可以补位,却又需要工程师耗费大量时间手把手搭场景,成本高还偏差大。

WorldGen 负责从真实影像中生成可交互的三维场景,场景内的3D物品全部都具备仿真导入能力。

谋先飞 的MotrixSim引擎负责物理与并行仿真,让机器人在其中运动、抓取和交互。

作为 NVIDIA Inception (初创加速计划) 的一员,影眸Hyper3D也正通过WorldGen实现英伟达全球仿真生态的进一步联结,将“单个资产用于Isaac Sim”拓展为 “整个场景用于Isaac Sim” 。

它先从概念图生成一版对象化场景,策划可以检查动线和空间,关卡设计师可以移动或替换道具,美术再决定哪些关键资产值得精修。

更方便的是 ,WorldGen生成后的独立资产能够直接进入Blender、Unity、PlayCanvas、团结引擎、Unreal Engine等DCC与实时引擎环境,进行材质调整、动画绑定、关卡编辑、性能优化等二次创作。

今年7月,影眸Hyper3D已经与 Unity中国 达成合作,合力构建打通从3D生成到实时游戏应用的工程闭环。

导演要把画面左侧盘子里的苹果移到右侧盘子,纯视频生成很难稳定控制; 用WorldGen建立可控3D基底,再用视频生成模型提升最终画面质量,这样则相当直接。

WorldGen提供3D场景,可以轻松完成镜头调度和构图调整,再交给视频生成模型,补齐人物表演、材质光影和最终风格。

WorldGen的 AI Render模块 则具备了AI渲染、自由运镜等功能,同一场景可以变换多种视觉风格,也为产品概念演示、空间导览等内容带来制作效率与品质的双重提升。

据了解,WorldGen如今已经进入实际影视项目的制作流程,相关作品将在完成后陆续上线。

既然场景可以从任意视角观察,主要对象又能被替换和移动,一张普通照片便有机会变成可以进入、浏览和调整的沉浸式空间。

从顶会最佳论文到产品化,WorldGen攒了整整一年

要理解WorldGen是如何一步“登天”的,还得从去年那篇 CAST 论文说起。

不是把图生3D连续运行十几次就能实现的。单张图片天生缺少深度、真实尺度和物体背面的信息,还存在遮挡和透视畸变。

比如一个苹果被盘子挡住,模型要先补全看不见的部分;稍微生成大一点,摆回桌面时就可能穿进盘子;位置再偏一点,后续碰撞体和支撑关系也会跟着出错。

Step 1 :模型把输入图片拆成对象,并估计相对深度,让一张没有结构的RGB图片变成对象清单和空间线索。

Step 2 :针对每个物体独立生成完整3D几何。遮挡感知机制会参考可见部分和场景信息,补出图片里看不到的区域。

Step 3 :把生成好的物体放回统一空间。系统需要估计旋转、平移和尺度,尽量保持与原图的构图和位置一致。

Step 4 :建立更细的物体关系图,描述接触、支撑、悬挂等关系,再结合SDF进行物理校正,减少互相穿透、悬空和不合理堆叠。

CAST支持开放词汇的重建任务,在处理遮挡、精确对齐物体以及确保物理世界与输入图像的一致性方面表现卓越,为 虚拟内容的创作 和 具身智能 相关领域开辟了新的可能性。

通过减少冗余模块、重构底层流程和提升单环节稳定性,才最终让WorldGen以 完全体形态 发布。

至于为什么说它是 「世界生成模型」 ,而非广义的「世界模型」或者「场景生成模型」,影眸Hyper3D联创兼CTO 张启煊 是这样定义的:

我们认为,世界生成模型是通过文本提示或一张图像,把其中描绘的场景还原为可用的三维世界。 它既能生成开放式场景,也更接近 “世界” 的表达。 它仍然是广义世界模型的重要组成部分,毕竟真正的“世界模型”需要某种载体来承载世界的外观与属性,只不过,影眸选择的载体是 3D 。

3D生成,进入场景级时代

它不会直接生成一款可以上线的游戏、一部完整的电影,也不会替具身智能完成训练和决策,但它解决的是所有这些产业共同面对的前置难题:

以 Hyper3D Rodin Gen-2.5 为代表的3D生成模型,已经将单资产制作周期从数天缩短至分钟乃至秒级,但真实项目中,极少只需要孤立资产。

后续不可避免要对不同形态、物理属性的资产进行 拼装 ,包括识别、校准、导入引擎等,这些仍然都需要人来做。

虽然距离最终成品仍有进步空间,但对于游戏设计师、影视创作者和仿真工程师而言,已经提供了一个能够继续编辑的起点。

对物理规律的模拟 ,才决定了WorldGen的上限。创造出的细节越多,就越真实、越好用。

当生成出的场景能够承载内容、模拟交互,并接入现有工作流,它吸引的便不再只是尝鲜的普通用户,还有真正需要提高生产效率的 专业创作者 。

3D生成原本就是最接近生产流程的AI应用之一。只有当生成结果能够被持续编辑、复用并投入生产,它的价值才会真正释放。

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型 2026-08-05

相关阅读

视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖

细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025

最新爆火3D生成模型,清北硬核00后成团再出击丨开源

3D生成补上物理短板!首个系统性标注物理3D数据集上线,还有一个端到端框架

清华系多模态大模型公司刚刚融了数亿元!放话“今年达到Sora效果”

3D版DeepSeek卷起开源月:两大基础模型率先SOTA!又是VAST

热门文章

Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

《时代》周刊全球AI 100放榜,精准捕获稚晖君最“想低调”的幕后老板

e生涯斩获浙江一等奖,同蚂蚁、浙大一道晋级数据要素国赛

去年归国的徐梦迪,成了清华姚班班主任

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1