GPT-6带火循环Transformer,阿里早已布局
最早是The Information爆料,Astra使用了这种「循环深度」技术:
让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深 。
由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?
OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。
一篇SpiralFormer ,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。
下一代架构候选,先过「计算冗余」这关
循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。
过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。
在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。
这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。
横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。
注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。
MeSH:同时解决「计算无分化」和「信息过载」
论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。
在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%的非嵌入参数。加入MeSH后,零样本下游平均准确率反而从普通Transformer的49.50%提高到50.56%,领先1.06个百分点 。
而MeSH新增的路由器参数,仅相当于普通Transformer非嵌入参数的约0.005%。
团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。
团队比较了hidden state经过每轮计算前后的变化幅度,结果发现第一个core loop承担了绝大部分更新,到了后面几个core loop,状态变化迅速缩小。
团队使用CKA分析不同循环之间的表示相似度,然后发现相邻轮次的hidden state高度接近。
一个是「计算无分化」 。同一组网络反复使用,又缺少明确的轮次信息,很难在不同阶段形成分工,容易沿用相似的计算方式。
另一个是「信息过载」 。同一份hidden state既要保存原始输入,又要装下前几轮结果,还得承担当前计算。长期记忆和临时加工全挤在一起,最后谁也干不好。
传统循环模型里,上一轮算完,直接把hidden state整份递给下一轮,再由同一组网络接着算。
虽然后来大家打过补丁,怕它算着算着忘了原题,就把最初的状态重新加回来,但不管算到第几轮、当前处理哪个token,信息的搭配规则都是写死的。
这个资料柜叫Memory Buffer,由多个记忆槽组成,用来保存原始输入和循环过程中积累的信息,不必全部挤在当前hidden state里。
一个是Write Router ,负责决定这一轮的新结果,应该按什么权重分摊到各个记忆槽。
另一个是Read Router ,负责在下一轮开始前,按不同权重读取各个槽位,重新组合成新的hidden state。
看到这里,关注过前段时间Hyper-Connections、mHC讨论的朋友,可能已经有点眼熟了。
Hyper-Connections把原先单路传递的残差信息扩展成多路,再通过可学习的映射,组合出交给计算层的输入,并把计算结果分配回多路状态。mHC进一步约束这些连接,改善深层传播的稳定性。
Memory Buffer把历史信息分流出去,hidden state终于能专心处理当前轮次。
这时候再用同样的三项指标重新检查,模型摸鱼时呈现的三个症状,果然都有了明显改善。
SpiralFormer:让每一轮看不同尺度的世界
既然不同循环可以处理不同信息,为什么还要让每一轮都盯着完整的token序列?
SpiralFormer给出的答案,是把每轮循环的序列长度seq_len也变成可调的。这一成果刚被EMNLP 2026接收。
简单来说,他们受Coconut等隐式思考工作的启发,意识到模型中间的「思考」并不一定每一步都要维持完整、显式的token序列,也可以先压缩成更紧凑的表示,在潜空间中继续计算。
在Pythia-1.4B级别的实验中,SpiralFormer-L和普通Transformer的参数量基本相同,计算量却从14.08T FLOPs降到13.13T,5-shot下游平均准确率则从51.93%提高到54.37% 。
论文采用的一种典型方案,是先从原序列的1/8长度开始,之后依次扩展到1/4、1/2,最后回到完整序列。
第一轮先看城市全貌,弄清不同区域之间的关系,然后逐步放大,看到街区和道路,最后再落到具体位置。
回到论文就是,SpiralFormer在每轮循环开始前,都会对序列做一次「缩放」:
把相邻token划成一组,通过可学习的权重聚合成一个更粗的表示。压缩完的序列更短,Attention要算的token少了,计算量自然往下掉。
这里需要注意,考虑到模型生成文本时不能偷看后面的内容,SpiralFormer还对写回结果做了右移,避免压缩操作泄露未来信息。
这套「先看全局、再抠细节」的说法,到底只是设计者的一厢情愿,还是模型真的学会了?
结果显示,早期的低分辨率循环中,注意力分布得更广,会同时关注较大范围的信息,而到了后期的高分辨率循环,注意力开始集中到少数关键位置。
循环初期建立global pattern,随着循环推进,再逐渐转向local pattern 。
相比之下,始终处理完整token序列的普通LoopedFormer,虽然也会出现类似变化,但趋势更弱,也不够稳定。
这说明,从全局到局部的分工并不会随着循环自动出现,多分辨率设计才是关键驱动因素。
随着循环比例提高,模型表现先变好,在30%到40%左右达到最佳,继续增加循环,过度共享参数又会拖累效果。
一篇管信息,一篇管尺度
MeSH解决每轮「拿什么算」,SpiralFormer解决每轮「以什么粒度算」。
过去大模型要想Scaling,主要靠参数、数据和训练算力这三大支柱。推理模型兴起后,又多了一种做法,即让模型生成更长的思维链,用更多token换更好的答案。
计算可以在hidden state里继续进行,同一组参数反复使用,模型规模可以不变,内部计算却能一层层加深 。
这也是MeSH和SpiralFormer存在的意义,它们正是在把这种可能一步步做实。
围绕Astra和Mythos,外界还在热议「到底有没有用循环架构」「这会不会成为下一代路线」。
MeSH获ICLR 2026接收,SpiralFormer获EMNLP 2026接收,顶会的认可也算是给这番持续深挖增加了更多含金量。
早在2018年的Universal Transformer中,研究者就开始尝试反复使用共享层。
近几年,Looped Transformer、recurrent depth和latent reasoning等研究又陆续出现,背后都是同一个念头:
MeSH:https://arxiv.org/abs/2510.07739 SpiralFormer: https://arxiv.org/abs/2602.11698
刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500% 2026-08-28
650亿美元!IPO前夕,Anthropic营收底牌曝光 2026-08-18
WorkSwarm:引领办公智能体新范式,让AI从一个助手,进化为一支与你并肩作战的团队 2026-08-16
相关阅读
真如摄影、细至发丝!阿里开源新一代图像生成模型Qwen-Image
百望股份阿里云推出首个垂类MCP服务,强强联合领跑数据智能赛道
阿里达摩院正式加入5G巨头仗:瞄准新基建,成立XG实验室,要与华为战一战
达摩院突破冯·诺依曼架构性能瓶颈,新型AI芯片性能提升10倍
马云宣布启动第三批非洲应急物资捐赠,其中包括460万个口罩
AI绘图模型不会写字的难题,被阿里破解了
热门文章
「GPT-6」灰测demo刷屏!周四发布在即
李飞飞发布:全球首个多模态世界模型
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍
VC疯了!200万现金冠军奖,又花4000万造了一座AI「创业乌托邦」
阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1