AI 日报hiw3c.com

时隔十年,AI大牛署名新论文

量子位 www.qbitai.com 网页快照

时隔十年,AI大牛署名新论文

杰西卡 发自 ROBO-人 量子位ROBO | 公众号 AI4ROBO

最近,任少卿指导发布论文 《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》 ,提出一种新的多模式世界—动作联合模型。

公开学术记录中,他的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等一系列计算机视觉经典工作。

这一次,他重新以通讯作者身份出现在自动驾驶论文中。论文第一机构为NIO,多位作者来自蔚来,研究方向也直接指向世界模型和规划。

这篇论文要解决的核心问题很明确:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。

团队的思路是:让模型一次生成多组场景—动作假设,车辆轨迹与对应的未来场景共同演化,最后再从中选择。

简单来说,自动驾驶不仅能看清周围环境,还能预演多种可能的未来,最终选择最安全的路径执行。

从一条轨迹,扩展到多个未来

World–Action Model则进一步增加了未来场景建模,让规划不仅依据当前环境,也参考动作可能带来的后果。

一类是 级联式方案 。例如先生成几条候选轨迹,再分别预测每条轨迹对应的未来场景;或者先预测未来场景,再基于场景完成规划。这种方式可以生成多个候选结果。

但这种方法的问题也很明确:信息按 单向传递 ,后生成的变量无法回头修正前面的决策。

假如模型已经先确定自车向前通过路口,随后才预测到对向车辆没有减速,这个未来结果很难重新参与前面的动作生成过程。

车辆动作变化,预测环境随之调整;环境一旦变化,也会反过来影响车辆轨迹。现有这类方法通常只生成一组场景—动作结果。

论文指出了其中的空白:级联式模型可以覆盖多种驾驶结果,但场景和动作之间缺乏双向交互;联合模型具备双向交互能力,但通常只生成单组结果。

MM-Future给出的方案是: 一次生成多组场景—动作假设,每一组内部的场景和动作继续共同演化。

每一组结果叫做paired scene–action hypothesis(配对场景-动作假设)。

假设模型同时生成几十组候选,其中一组可能是自车加速、对向车辆让行,另一组是自车减速、对向车辆先行,还有其他不同程度的制动、通过方式以及场景变化。

这些结果不再只有轨迹差异,每条轨迹对应的未来环境也各不相同。由此,多种可能的未来进入规划过程。

同时推演几十个未来,需要面临的三道门槛

*多样性从哪里产生,多组未来如何控制计算成本,以及生成多个候选后如何筛选。MM-Future的核心设计也是围绕这三个问题展开。

真实驾驶数据有天然局限,一段录像只记录一种已经发生的结果。司机最终减速,数据中就不会同时留下同一时刻选择加速后的真实场景。模型需要在单结果监督下学出多种合理结果。

MM-Future在动作端根据训练轨迹分布建立了Gaussian Mixture Noise,从不同动作先验出发;场景端则使用独立噪声。

训练时又加入 Best-of-Many监督 。模型一次生成多组候选,先找出与真实轨迹最接近的一组,再用同一个赢家索引监督动作流和场景流。

这样可以避免所有候选被同一条真值轨迹拉向相似结果,也能保持一条轨迹和它对应的未来场景始终配对。

其次是 计算成本 。多视角视频如果按每种候选完整展开,模式数量和预测时间一增加,计算量会迅速上升。

作者提出了 MM-Tokens ,将 多摄像头、多时间帧 的视觉特征压缩为面向规划的紧凑表示。

MM-Tokens不承担RGB图像重建,也不需要恢复完整BEV。有限的Token预算主要保留与未来演化和驾驶规划相关的信息。

从论文给出的注意力可视化来看,MM-Tokens关注的信息主要集中在 道路结构、路口、前车以及周围交通参与者等区域 。

模型由此无需为几十种候选分别生成完整的高清未来视频,内部保留的是一组面向规划的紧凑未来场景表征。

第三项是 场景与动作如何共同演化,以及多组候选如何筛选 。MM-Future使用了modality-aware Transformer同时处理动作流和场景流。

因此,动作轨迹会随着配对场景的变化继续更新,场景预测也会根据自车动作重新调整。多轨迹规划由此引入了动作与环境的双向耦合。

生成结束后,Future-Conditioned Proposal Scorer负责完成最后筛选。

它评估一条候选轨迹时,同时读取历史信息和这条轨迹专属的预测未来,再给出分数。每个候选只能读取自己配对的未来,不能借用其他模式的场景结果。

论文还对轨迹和未来Token使用stop-gradient,避免生成器为了提高评分而改变输出分布。

最终推理过程可以压缩成四步:编码历史观测,生成多组场景—动作结果,使用历史与配对未来给候选评分,再输出得分最高的轨迹。

世界模型开始更深层进入规划

在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS。同一张结果表中,WAM方案DriveFuture为90.7,E2E方案DrivoR trainval为93.7。

NAVSIM-v2上,MM-Future获得91.5 EPDMS,高于论文列出的UniTeD 90.1和DriveFuture 89.9。

只生成动作、仅保留一种模式时,PDMS为84.1;把动作候选增加到32种后提升到92.3。

加入场景—动作联合生成后,单模式为85.1,32模式达到92.9。最后让评分器读取每条轨迹对应的预测未来,PDMS继续提升到93.3。

几组对照分别验证了三个环节:增加模式数量带来主要增益;场景和动作联合生成还能继续提升;配对未来参与候选评分后,规划指标再次改善。

评分器带来的提升在 TTC指标 上最明显,论文据此认为:候选专属未来主要帮助模型排除交互风险较高的轨迹。

多模式训练还表现出更快的收敛速度。16模式和32模式达到0.80验证PDM分数大约需要3.8k steps,单模式需要17.5k steps。

这个结果说明,多种假设不仅增加了推理分支,在论文设定下也改善了训练效率和最终指标。

论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约为233ms。

16种候选的延迟和单模式方案较为接近,增加到32种后延迟明显提高。候选覆盖范围和计算成本之间仍需要平衡。

MM-Future没有针对HUGSIM继续微调,在436个场景上取得32.3平均HD-Score,高于论文列出的Latent-WAM 28.9和UniAD 28.6。

平均Route Completion为44.5,略低于Latent-WAM的45.9;Extreme难度下HD-Score为8.6,Latent-WAM达到18.1。

论文也主动指出了可解释性问题。MM-Tokens属于隐式场景表征,模型到底保留了哪些规划信息,目前仍难直接观察。

作者计划增加辅助感知模块,把与规划相关的场景结构进一步可视化,以提升模型透明度并辅助故障诊断。

自动驾驶世界模型的角色正在从未来预测进一步走向规划,模型不仅需要估计场景会怎样变化,还要比较不同动作对应的不同场景结果。

更关键的变化发生在多模式的定义上。以往多模式规划主要回答可以走哪几条轨迹,MM-Future把问题扩展到采取不同轨迹后,环境分别可能怎样变化。世界模型开始承担动作后果建模的一部分功能。

这条路线仍处于公开数据集和仿真验证阶段,计算开销、隐式表征、极端场景稳定性都需要继续验证。

论文当前能够支持的结论更明确:在自动驾驶规划中,同时覆盖多种可能结果,并让场景与动作保持双向交互,能够带来稳定的指标增益。

真实道路始终存在多种合理结果。随着世界模型继续进入规划环节,自动驾驶需要处理的对象,也正在从一条候选轨迹,扩展到一组动作与未来的联合结果。

团队介绍

第一作者Shuai Liu同时署名NIO和中山大学计算机学院。他此前已经在端到端自动驾驶方向有过研究积累,2025年曾以第一作者发表GaussianFusion,尝试用紧凑的高斯表示完成多传感器融合,并被NeurIPS 2025接收。

论文另外几位作者中,Hechangle Gong同时署名NIO和北京航空航天大学,Hao Jiang、Runlin He、Junxiang Zhan、Sheng Yang均署名NIO,Kai Huang来自中山大学。

他是国内自动驾驶深度学习化最关键的那批推手之一,目前为中国科学技术大学讲席教授,中科大官网显示其担任通用人工智能研究所所长;也仍是蔚来智能驾驶业务负责人。

2024年,蔚来发布NIO WorldModel和NADArch 2.0,将智能驾驶架构进一步转向世界模型驱动的端到端体系;2025年又加入全闭环强化学习,2026年初最新版NWM开始大规模推送。

蔚来最新披露,截至今年9月,这套基于世界模型和全闭环强化学习的智驾系统已经部署到超过95万辆车。

先让模型预测未来,再让未来进入规划;从生成多条轨迹,继续走向同时生成多组动作与未来。

华为全新智驾上车,全域L3架构,岚图最强旗舰MPV 42万开卖 2026-09-23

被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」 2026-09-16

企业级Agent落地样板间!百融硅基员工批量上岗,按结果领工资 2026-09-02

50万!李想宣布MPV进入iPhone时刻!外观没改配置拉满 2026-09-03

相关阅读

宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战

马斯克也开始L4降维L2了!FSD正式进入反转时刻

广汽曾经爱搭不理,现在华为智驾首发不起

前华为高管苏箐亮相地平线,时隔四年再次开麦:搞自动驾驶不能活在营销里

一个广告营销老炮,率先冲刺A股无人驾驶第一股

百度无人车新纪录:周订单破35万!李彦宏:开始单城盈利了

热门文章

刚刚,Claude Code大重构!内部3万Agent管理技术免费开放

AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

白天务农晚上码农,这个斐济农民跨越一万公里来拼多多取经

Manus重生第17天,估值居然就翻倍了

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1