腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026
算力与显存边界的硬性制约 :基于标准 Transformer 自注意力机制的计算与 KV Cache 显存开销随序列长度呈二次方级攀升。在长达数十分钟甚至数小时的连续视频输入下,即便采用先进的长序列优化策略,端侧受限硬件也很容易因为显存急剧膨胀而无法继续运行。
时序下采样对几何连续性的破坏 :工程中常用的均匀抽帧或关键帧截取方案,本质上是以牺牲细粒度时序信号为代价来换取计算效率。但 3D 空间关系高度依赖连续的视差与几何线索,大幅跳帧会让模型直接漏掉关键的空间信息,而且事后很难补回来。
为什么不能全用 TTT?
3:1 混合架构的取舍
3:1 的层级交织 :在 Decoder 里,每 4 层注意力中有 3 层改成 TTT 层,专门负责长视频里空间时序信息的动态压缩和增量更新;
保留 25% 的全注意力锚点层 :这些层继续做全局注意力,参数不更新,主要负责跨模态特征的全局对齐和逻辑推理,用很低的计算代价保住预训练模型原有的推理能力。
主干路(TTT 分支) :负责跨 Chunk 的长程记忆,通过持续更新快权重来保存长期的空间环境信息;
旁路(滑动窗口注意力 SWA) :和 TTT 分支共享?、?、?投影,窗口大小? 不小于 Chunk 大小?。SWA 负责覆盖 Chunk 内部的因果注意力,把单帧内部以及相邻帧之间的细粒度时空关系补回来。
空间结构被打碎 :视频被切块、展平成一维序列后,逐点投影把原本相邻的像素和体素拆成了互不相干的点。局部视差、边缘连续性、深度梯度这些天然存在的空间关系,在进入快权重更新之前就已经丢失了。
缺少空间先验,只能硬猜 :快权重本质上是靠拟合当前块的 ?和?来记东西。如果 ? 和?本身没有局部空间信息,它就只能从一堆孤立的点里硬推 3D 结构,既容易造成梯度震荡,学到的空间表示也不稳定。
训练数据怎么选?
从稀疏问答到密集场景描述
全局场景环境 :说明房间类型和整体布局,先让快权重建立起宏观空间框架;
实体清单与精准计数 :详细列出视野中出现过的所有物体类别和数量,促使快权重在长时序中持续追踪每个实例,避免物体移出视野后就被忘掉;
物体空间关系 :描述物体之间的相对方位和距离,引导快权重记录它们的空间布局关系。
实验结果:2B 模型在空间基准
和长视频上的表现
滑动窗口 KV Cache :仅维护固定长度?的局部上下文,超出的历史键值对直接丢弃,显存占用恒定;
TTT Pending 缓存 :仅作为增量累积单元,一旦达到 Chunk 大小? 便触发一次快权重更新,随后立即清空。
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群 !进群你会解锁这些「福利」 ?
会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。
Google 牺牲了图片分辨率、编辑能力和准确性换取了 ...
大模型也得「睡觉」了:Google 的这篇论文,戳中了A ...
7 年 Google 老兵写出爆款工具被开除,转头官方发同 ...
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
从「3D相册」到「物理底座」:CVPR 2026 开启 3DGS 的具身智能时代
BIMSA 王雅晴:Scaling Law 触及天花板,「数据高效学习」指向 AI 的下一站|IJCAI 2026
机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪
7 篇 ECCV 论文!极佳视界联合顶尖高校,打通空间智能从「看得稳」到「摸得准」再到「决策灵」的落地瓶颈
群核科技联手英伟达、英特尔、浙大,三篇 ECCV 论文给物理 AI 造基础设施
机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?