实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
画面更夯,控制更细,但一旦走到实时生成这一步,继续往上做能力,就会有个很难绕开的坎:
更麻烦的是,实时世界模型还得面对世界模型的共性难题,相比LLM,能力想沿着稳定路径 持续增长 也没那么容易。
然而,这个困扰行业多年的实时世界模型的老bug,如今,已经有厂商用实际模型完成验证并跑出了答案——
其实今年1月的时候,爱诗就发布了首个通用实时世界模型R1,主打持续生成能力,当时直接在网上火出圈了一波。
这回,R2直接把LLM里那套规模继续加、能力继续涨的Scaling逻辑,真正搬进实时世界模型里。
基于统一可扩展的世界模型框架,R2把完整的时空关系压进模型,让场景能够沿着时间持续演化,前后状态保持一致,让这个世界真正 「记得住」 。
不仅如此,R2还把文字、图像、声音、动作统一进模型,边生成边响应、音画同步,让世界真正 「控得动」 。
比如下面这个探险世界,用户不仅可以控制方向,还能基于Prompt控制场景角色,而且画面是实时生成的内种:
文章链接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA
当然,脑洞完全可以再大一点,比如游戏剧情也能DIY,一句指令就能改变眼前世界,世界剧情真·随意拿捏了:
文章链接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA
过去实时世界模型最大的难题之一,就是能力一旦往上堆,速度、稳定性和交互性往往也开始彼此拉扯。
当实时和通用能力同时成立,世界模型的能力边界和使用边界也会一起外扩,逐渐进入游戏、虚拟交互等场景。
从Scaling到能力预算,实时世界模型连撞两堵工程墙
主要在于,实时世界模型想把能力继续往上做,前面先横着技术工程上的两道「硬门槛」。
其中第一道门槛,便是整个视觉世界建模都绕不开的一道表征难题: 「信息」到底该怎么被统一表示和建模?
虽同样都隶属模型大类,世界模型在这件事上的先天条件,其实真没LLM那么友好。。。
好巧不巧的是, 语言 其实在信息形态上天然就占了便宜,因为它可以被压缩成一套 离散、序列化的符号系统 。
在这套体系下,每个Token都是边界清晰的语义单元,海量文本都可以被统一成有限符号的排列组合,训练任务也被高度归一为「预测下一个Token」。
于是,数据、参数和算力都能沿着同一套框架持续扩展,资源投入也更容易稳定转化为能力增长,这正是LLM能够充分释放Scaling潜力的底层前提。
因为 图像和视频 是一种 连续、高维且高度冗余 的信息形态,色彩、光影连续变化,单个画面就包含海量视觉变量,相邻像素和视频帧之间又存在大量重复。
此外,模型还得从这些原始信号中进一步抽取语义、状态变化乃至物理关系,信息结构远 比文本复杂 。
也因此,视觉领域长期缺少一套像文本Token那样紧凑、统一、可持续扩展的表征体系,视频模型想沿着同一条路径持续增长,天然要难得多。
因为一旦再加上实时两个字,难度还会再高一档,这也是实时世界模型面对的第二层门槛:
想维持稳定实时生成,每一帧留给模型的计算窗口可能只有几十毫秒,可世界模型想理解更多场景、更复杂的物理关系和更长程的时空变化,又需要更大的模型容量、更复杂的建模,以及更多计算。
2024年,Google DeepMind 11B参数的Genie已经能生成可交互环境,但到了Genie 2,场景和物理能力继续增强,实时性却更难兼顾,想跑到实时往往需要以 蒸馏 为代价,同时还要 牺牲部分画质 。
换句话说,对实时世界模型而言,真正难的从来都不是单独把模型做大,或者单独把速度做快,而是让通用能力和实时运行能够同时成立。
△Google DeepMind Genie 2报告 PixVerse R2:实时世界模型终于有了自己的增长曲线 所以说到这儿,实时世界模型碰到的难题就很清楚了。
想把实时性和通用能力一起做上去,先得解决一个底层问题—— 更多数据、任务和交互信号,怎么持续进入同一套能力体系。
前面我们说过,LLM能够持续Scaling,一个重要前提,就是语言本身拥有相对统一的Token表示和序列建模方式。
但对于实时世界模型来说,模型面对的不只有视觉,还包括动作、音频、长短不一的时间尺度,以及不断进入的各种控制信号!!
这些信息的数据形态、时间粒度和作用方式都不一样,想让这些能力继续一起增长,首先就得把它们收进一条统一的建模主线里。
便是把视觉、动作、音频、时序以及不同控制信号,放进同一套 可持续扩展 的 因果建模框架。
需要提一嘴的是,这里的Scaling可不单单指的是模型大小,还包括世界复杂度、控制力,以及怎么稳定运行~
更关键的是,当这些原本异构的信号开始被放进同一种表示体系里,复杂动态的世界也就有机会拥有一套类似语言Token的 统一计算坐标系 。
具体来说,R2把Scaling拆成了 模型、数据、任务、控制信号和时间尺度 五个彼此「协同增长」的维度。
模型规模决定容量,数据拓宽世界分布,任务强化跨场景迁移,控制信号增加交互精度,时间尺度则决定模型能把多长、多复杂的动态过程纳入建模。
任意一个维度增加资源,都能反过来增益其他维度,模型的整体能力就会上涨,不依赖单纯扩大参数量。
其实传统Scaling走到后期,一个越来越现实的问题,就是资源继续往上堆积,能力增益却未必还能同比例增长,新增算力和数据的边际收益开始变薄。
反观R2做的事情,更像是在世界模型身上重做 投入产出逻辑 ,让每一份新增资源都拥有更多能力出口,最终更充分地沉淀为整体模型能力。
落到咱用户真实体验上,就是 生成质量更高、长程一致性更稳、跨场景泛化更强,多模态控制也更细~
△AI生成 当然了,多说无益,这实时世界模型R2到底能不能打,我们直接看实际效果~
就比如我们不仅能在 赛博世界 中玩耍,甚至还能体验 互动影游 和 实时数字人 。
先来个小试牛刀,前阵子刚看完《奥德赛》,于是我索性一头扎进了一个奥德赛草原风格的世界里,现场勇闯一下:
文章链接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA
WASD一按,视角和方向随便转动,Prompt一敲,角色动作、剧情走向也能直接改,可控性确实不错。
最重要的是,实际体验下来,几乎没有卡顿和延时问题,实际在场感确实强,实时性也确实丝滑。
接下来我们再上一波难度,直接玩一把 互动影游 ,体验一把在魔法学院里魔法大乱斗:
文章链接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA
说实话,光看画面,还真有种穿越哈利波特电影里的感觉,确实蛮有大片感,画面质量过关~
但我最想说的,还不是画质,大家有没有发现,在这个互动影游里,眼前的世界是可以被你 临时改写 的。
比如直接在Prompt框里输入想使出的攻击魔法,下一秒画面就会顺着你的指令继续往下演,确实有点爽。。。
省下来的时间和精力,终于可以花在一件更重要的事上——到底想创造一个什么样的世界。
能力先拉满,实时再追回来
帧率和延迟一旦锁定,单帧算力预算也基本见顶。行业往往只能靠缩模型、减采样、压计算,把重模型塞进毫秒级窗口,生成质量、复杂运动和长程一致性也会随之受损。
先把基础模型的能力上限做高,再解决实时化,这样实时世界模型的天花板就不会过早被单帧计算预算锁死,而更多取决于底层模型本身能学到多少世界规律。
这也是R2整个技术体系里, Omni Causal AR 和 Real-Time Acceleration 两层架构真正的分工,前者管能力上限,后者管实时性。
对于想持续Scaling的实时世界模型来说,一大难题在于模态、控制信号和时间尺度越加越多,建模很容易越做越碎。
所以第一步,Omni Causal AR先把短视频、长视频、多模态参考、音频和Action控制,统一进一套 因果自回归框架 ——
通过动态Chunk适配不同时间尺度,再用Hybrid Teacher/Diffusion Forcing、多时间尺度记忆和Error Bank解决长程生成中的误差累积、角色漂移和状态断裂问题。
这样一来,新增数据、任务、控制信号和模型规模,都可以持续转化为更强的世界建模能力~
这边能力先做高之后,Real-Time Acceleration再接手第二道题——
持续预训练后,Omni Causal AR先把生成质量、长程状态和因果能力做扎实,再作为Teacher和Student共同的能力底座,让后续蒸馏尽可能沿用同一套世界理解逻辑,把这套能力更完整地压进实时预算里。
需求高度分散、场景持续变化、长尾永远收不完,模型每天都在被用户用各种意想不到的方式重新「考试」。
而世界模型最终要面对的,恰恰也是同一类问题:如何在一个持续变化、充满噪声、随时会被外部输入打断的环境里,维持状态、理解变化,并继续推演下一刻。
R2这种先放大能力、再单独解决实时效率的路线,也更像是 长期产品实践 和 技术积累 自然形成的一种架构选择。
当然了,更值得注意的是,这套架构一旦成立,它的外溢价值就很难只停留在视频生成层面。
在未来, 内容生产、具身智能、虚拟人、游戏实时渲染 ,都可能逐渐汇向同一种底层能力:
剧情、场景和角色不再只是预先写好的固定内容,其会逐渐变成可以随着用户行为持续展开、持续变化的动态系统。
到那时创作者需要亲自定义的,也许会越来越少是某一帧、某一段资产,而越来越多地转向 一个世界如何运转、角色如何行动,以及规则本身 。
从“会回答”到“会办事”,vivo如何解AI手机这道题? 2026-09-17
千万奖池找“鲸锐”!单项奖金200万,只等一个最会用AI讲故事的你 2026-09-19
华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够 2026-09-19
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水 2026-09-19
相关阅读
大事不好!机器人学会预测未来了
LeCun三顾茅庐,谢赛宁终于入伙!新公司获投10亿美元
华为具身大脑一号位创业,用认知科学造世界模型,获亿元级融资
“谷歌版Sora”被嘲画质好糊,但在世界模拟器上又前进了一步
实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招
世界模型+强化学习:轻舟智航于骞在德国定义通向通用物理AI的必由之路
热门文章
从“会回答”到“会办事”,vivo如何解AI手机这道题?
刚刚,唐杰发布智谱RSI首个成果
刚刚,Claude Code大重构!内部3万Agent管理技术免费开放
协同办公进入Agent时代,飞书+豆包工作跑在了最前面
央企做了个通用Agent,直接杀进IDC实测前三!
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1