GPT-6带火循环Transformer,阿里早已布局

量子位拆解 GPT-6 Astra 引发的循环深度讨论,以及阿里两篇论文如何分别处理循环 Transformer 的信息管理与计算尺度问题。

转载说明:本文转载自微信公众号「量子位」,公众号 QbitAI;原文发表于 2026 年 9 月 5 日。原文正文未显示作者署名,本文保留原文报道内容、主要表述和判断,并清理微信页面导航、关注引导、二维码及装饰性页面残留。
GPT-6 Astra 发布后,recurrent depth(循环深度)突然成了讨论中心:让同一组 Transformer 层反复运行,在参数规模增长较慢的情况下,把计算深度继续往下推。
这条路线真正要回答的问题是:模型多算几轮之后,究竟有没有得到新的东西?量子位在这篇报道中追踪了循环 Transformer 的计算冗余问题,并把阿里及合作高校的两篇论文放进同一条技术脉络里:MeSH 管循环之间如何交接信息,SpiralFormer 管每一轮应该以什么尺度计算。1

循环 Transformer 为什么又热起来了

传统的模型扩展主要依靠增加参数。循环 Transformer 提供了另一种思路:同一组参数重复运行,用计算深度换参数规模。比如,24 层模型需要 24 套参数;一个 8 层模型反复运行 3 次,也能完成相近的深度计算。参数量因此有机会下降,模型内部的计算轮数则可以增加。1
GPT-6 Astra 让这条偏学术的路线进入行业聚光灯。报道还提到,Claude Mythos 曾在 GraphWalks BFS 的长上下文测试中拿到 80.0%,GPT-5.4 为 21.4%,Opus 4.6 为 38.7%。这类测试要求模型沿着复杂关系网连续寻找节点,考验模型在隐状态里多轮处理信息的能力。
Mythos 是否采用了循环架构,官方没有说明。量子位保留了这个边界:外界把 Mythos、Astra 与循环计算联系在一起,依据仍然是公开表现和技术传闻,而非完整架构确认。1

多算几轮,为什么会空转

循环计算的难点落在“计算冗余”上。模型确实重复执行了矩阵运算和 Attention,但后面的循环带来的状态变化会越来越小:第一轮更新幅度较大,后面几轮的增量迅速收窄。
量子位转述了论文团队找到的三种迹象:后面的循环越来越不爱动;相邻循环产生的 hidden state 高度相似;循环继续进行后,模型表示逐渐挤进低维空间,能够表达信息的方向变少。三种迹象放在一起,说明共享网络反复运行时容易重复相似的计算。1
论文把原因归为两点。第一,同一组网络缺少明确的轮次分工,容易在不同循环中沿用相似的计算方式。第二,原始输入、前几轮结果和当前加工过程都挤在同一个 hidden state 里,信息彼此干扰。循环模型需要重新安排“上一轮算完之后,下一轮究竟接手什么”。1

MeSH:给循环之间加一个“资料柜”

MeSH 解决的是信息管理问题。论文首版于 2025 年 10 月公开,现已被 ICLR 2026 接收。Pythia-1.4B 级别实验中,循环结构通过共享权重减少了约 33% 的非嵌入参数;加入 MeSH 后,零样本下游平均准确率从普通 Transformer 的 49.50% 提升到 50.56%。新增路由器参数约占普通 Transformer 非嵌入参数的 0.005%,额外计算开销约为 0.014%1
MeSH 的做法,是把一部分信息从当前 hidden state 里分流出去。它设置了由多个记忆槽组成的 Memory Buffer,保存原始输入和循环过程中积累的信息。
每一轮都有自己的 Write RouterRead Router。前者决定本轮的新结果按什么权重写入不同记忆槽,后者在下一轮开始前读取各个槽位,再组合出新的 hidden state。不同轮次、不同 token 都可以学习不同的读写权重。
这样安排之后,当前 hidden state 可以集中处理本轮计算,历史信息则由记忆槽保存;共享网络也有机会在不同循环里形成分工。量子位用三项指标重新检查后发现,状态变化变小、循环间表示相似、表示逐渐单一这三种现象都得到改善。1
MeSH 仍留下一个问题:每一轮依然要在完整 token 序列上计算。信息有了分工,计算尺度仍然固定。SpiralFormer 接着处理的,正是这个问题。1

SpiralFormer:让每一轮看不同尺度

SpiralFormer 关注序列长度。论文刚被 EMNLP 2026 接收,核心想法是让模型在循环的不同阶段使用不同分辨率的 token 序列。
典型流程是从原序列的 1/8 长度开始,再依次扩展到 1/4、1/2,最后回到完整序列。模型先用较短的序列建立全局关系,再逐步恢复细节。每轮开始前,相邻 token 会通过可学习权重聚合成更粗的表示;计算结束后,结果再写回原来的 token 位置。为避免文本生成时读取未来内容,写回结果还要进行右移。1
在 Pythia-1.4B 级别实验中,SpiralFormer-L 与普通 Transformer 的参数量基本相同,计算量从 14.08T FLOPs 降到 13.13T FLOPs,5-shot 下游平均准确率从 51.93% 提升到 54.37%。模型用更少的计算完成了更高的测试得分。1
团队还检查了 Attention 的分布。早期低分辨率循环会同时关注更大范围的信息,后期高分辨率循环则更多聚焦少数关键位置和附近 token。这个结果支持了一种逐步变化的分工:循环前段处理 global pattern,后段转向 local pattern。普通的 LoopedFormer 也会出现类似趋势,但变化更弱、稳定性也更差。1
SpiralFormer 还改变了循环层所占比例。团队在参数量和训练计算预算保持不变的条件下调整循环比例,结果呈现 U 形曲线:循环比例提高后,模型表现先提升,在 30%—40% 左右达到较好水平,继续增加循环后,共享参数过多会拖累效果。1

一篇管信息,一篇管尺度

MeSH 与 SpiralFormer 处理的是循环 Transformer 的两个不同瓶颈:MeSH 让每一轮重新分配信息,回答“这一轮拿什么算”;SpiralFormer 调整 token 序列的分辨率,回答“这一轮以什么粒度算”。
两篇论文共同指向一种模型扩展方式:参数规模可以保持相对稳定,内部计算则通过多轮循环继续加深。这个方向仍然需要付出计算成本,它节省的主要是参数,而非所有推理算力。只有当后续循环持续产生有效增量时,循环架构才有机会用更少参数支撑更强模型。1
从 Universal Transformer 在 2018 年尝试共享层,到近年的 Looped Transformer、recurrent depth 与 latent reasoning,研究者一直在追问同一个问题:模型变强,除了继续增加规模,能否让现有参数多计算几轮?Astra 的出现把这个问题从论文路线推向了产业讨论。1
量子位的收束也很克制:MeSH 已被 ICLR 2026 接收,SpiralFormer 已被 EMNLP 2026 接收,论文结果让循环路线多了一些工程依据;至于下一代高效大模型是否会从这里发展出来,仍然需要更多实验验证。原文列出的论文入口是 MeSHSpiralFormer1

原文摘录

“多循环几圈,模型真的就会更强吗?”
——量子位官方公众号原文。1
“循环 Transformer 又提供了一种选择:计算可以在 hidden state 里继续进行,同一组参数反复使用,模型规模可以不变,内部计算却能一层层加深。”
——量子位官方公众号原文。1
“模型想变强,除了继续长大,能不能也让现有参数多想几轮?”
——量子位官方公众号原文。1

Fuentes de referencia

  1. 1
    量子位原文

    mp.weixin.qq.com

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado