NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
告别“只读不练”:多模态 AI
如何从“看懂视频”跨入“具身体验”?
Show-o 架构突破:
用单个 Transformer
打通“文本生成”与“高效绘图”
从静态生成到动态视频:
Show-2 破解多模态统一的三大技术瓶颈
大脑落地物理世界:
从多模态大模型到机器人闭环控制
VLA 策略模型:在 VLM 底座的基础上加入动作调制层,能够根据视频输入和指令直接预测机器人应采取的物理动作。
世界模型(World Model):能够以当前视觉和动作输入为条件,预测未来环境的像素级变化。
世界动作模型(World Action Model, WAM):将两者融为一体,实现了“既预测动作,又预测未来动作产生的视觉结果”的闭环。
现场互动 Q&A
▎ 问:在 Show-2 中,团队将视觉理解与生成统一到了同一个模型架构中,并展现出了极高的灵活性与效率。请问在特定领域数据相对稀缺(Data Scarce)的场景下,这种统一理解与生成的架构,是否能比分立的模型带来更显著的性能提升?
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群 !进群你会解锁这些「福利」 ?
会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。
中国公司牵头ECCV Workshop!多模态AI大牛轮番登台, ...
CVPR 2026 | VesMamba:3D肺部血管精确分割法
ECCV 2022 | 创新奇智提出通过单品示例进行基于原型 ...
ACL 2022奖项公布!达摩院、华为等机构获奖,陈丹琦 ...
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
从「3D相册」到「物理底座」:CVPR 2026 开启 3DGS 的具身智能时代
机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
BIMSA 王雅晴:Scaling Law 触及天花板,「数据高效学习」指向 AI 的下一站|IJCAI 2026
TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026
AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型
3D 重建下半场开幕,ECCV 首场14篇Spotlight 把高斯泼溅推到了哪儿
浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026
ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪