GPT-6带火循环Transformer,阿里早已布局
手握两篇顶会论文
GPT-6 Astra一发布,recurrent depth突然一夜火了!
最早是The Information爆料,Astra使用了这种「循环深度」技术:
让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深 。
??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。
不出所料,争议很快到来。。。
由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?
OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。
Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。
边等小作文,边让我们把目光拉回循环Transformer本身:
多循环几圈,模型真的就会更强吗?
同等算力下,省了参数的循环模型,经常打不过普通Transformer。
卡住它的,是一个相当现实的问题:
有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。
一篇MeSH ,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。
一篇SpiralFormer ,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。
循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。
过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。
效果能不能追上,还需要实验说话,但需要存储的参数确实少了。
用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了 。
其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。
当时最抓眼球的,是一项图搜索成绩。
在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。
Mythos Preview得分接近GPT-5.4的四倍。
这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。
找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。
巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。
于是Mythos的成绩一出来,外界很快便把两者联系到了一起。
至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。
不过从Mythos到Astra,大家期待的其实是同一件事:
模型不用一直长大,也能靠内部多算几轮,把能力提上去 。
这也让循环架构成为下一代高效大模型的候选路线之一。
不过问题来了,多算几轮,和多算出点东西,还真是两回事!!
看看这张图就明白了。
横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。
纵轴表示计算前后hidden state的相对变化幅度。
第一个core loop更新很大,后面两个却迅速缩小。
注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。
这正是计算冗余的尴尬:
循环次数增加了,后续计算带来的增量却越来越小 。
来自阿里及合作高校的研究团队,正是从这里入手一路深挖。
他们先查清循环为什么空转,再想办法让后面几轮真正干上活。
团队首先给出的解法叫MeSH,现已被ICLR 2026接收。
论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。
论文拉到底,先看效果。
在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%……
原文链接:https://www.qbitai.com/2026/09/484726.html
← 返回 AI 资讯列表