AI 日报hiw3c.com

NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026

雷峰网·AI 科技评论 www.leiphone.com 网页快照

NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026

告别“只读不练”:多模态 AI

如何从“看懂视频”跨入“具身体验”?

Show-o 架构突破:

用单个 Transformer

打通“文本生成”与“高效绘图”

从静态生成到动态视频:

Show-2 破解多模态统一的三大技术瓶颈

大脑落地物理世界:

从多模态大模型到机器人闭环控制

VLA 策略模型:在 VLM 底座的基础上加入动作调制层,能够根据视频输入和指令直接预测机器人应采取的物理动作。

世界模型(World Model):能够以当前视觉和动作输入为条件,预测未来环境的像素级变化。

世界动作模型(World Action Model, WAM):将两者融为一体,实现了“既预测动作,又预测未来动作产生的视觉结果”的闭环。

现场互动 Q&A

▎ 问:在 Show-2 中,团队将视觉理解与生成统一到了同一个模型架构中,并展现出了极高的灵活性与效率。请问在特定领域数据相对稀缺(Data Scarce)的场景下,这种统一理解与生成的架构,是否能比分立的模型带来更显著的性能提升?

为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群 !进群你会解锁这些「福利」 ?

会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。

中国公司牵头ECCV Workshop!多模态AI大牛轮番登台, ...

CVPR 2026 | VesMamba:3D肺部血管精确分割法

ECCV 2022 | 创新奇智提出通过单品示例进行基于原型 ...

ACL 2022奖项公布!达摩院、华为等机构获奖,陈丹琦 ...

别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」

从「3D相册」到「物理底座」:CVPR 2026 开启 3DGS 的具身智能时代

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

BIMSA 王雅晴:Scaling Law 触及天花板,「数据高效学习」指向 AI 的下一站|IJCAI 2026

TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026

不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026

AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型

3D 重建下半场开幕,ECCV 首场14篇Spotlight 把高斯泼溅推到了哪儿

浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026

ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪