2026-09-06量子位

GPT-6带火循环Transformer,阿里早已布局

手握两篇顶会论文

GPT-6 Astra一发布,recurrent depth突然一夜火了!

最早是The Information爆料,Astra使用了这种「循环深度」技术:

让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深 。

??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。

不出所料,争议很快到来。。。

由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?

OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。

Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。

边等小作文,边让我们把目光拉回循环Transformer本身:

多循环几圈,模型真的就会更强吗?

同等算力下,省了参数的循环模型,经常打不过普通Transformer。

卡住它的,是一个相当现实的问题:

有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。

一篇MeSH ,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。

一篇SpiralFormer ,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。

循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。

过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。

效果能不能追上,还需要实验说话,但需要存储的参数确实少了。

用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了 。

其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。

当时最抓眼球的,是一项图搜索成绩。

在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。

Mythos Preview得分接近GPT-5.4的四倍。

这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。

找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。

巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。

于是Mythos的成绩一出来,外界很快便把两者联系到了一起。

至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。

不过从Mythos到Astra,大家期待的其实是同一件事:

模型不用一直长大,也能靠内部多算几轮,把能力提上去 。

这也让循环架构成为下一代高效大模型的候选路线之一。

不过问题来了,多算几轮,和多算出点东西,还真是两回事!!

看看这张图就明白了。

横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。

纵轴表示计算前后hidden state的相对变化幅度。

第一个core loop更新很大,后面两个却迅速缩小。

注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。

这正是计算冗余的尴尬:

循环次数增加了,后续计算带来的增量却越来越小 。

来自阿里及合作高校的研究团队,正是从这里入手一路深挖。

他们先查清循环为什么空转,再想办法让后面几轮真正干上活。

团队首先给出的解法叫MeSH,现已被ICLR 2026接收。

论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。

论文拉到底,先看效果。

在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%……

数据来源:量子位
原文链接:https://www.qbitai.com/2026/09/484726.html
查看原文 ↗
← 返回 AI 资讯列表