《The Information》报道 OpenAI 下一代模型 Astra 采用了"循环深度"(recurrent depth)架构,还称这项技术"以遮蔽模型推理过程的方式工作"——一时间,"循环变压器"被传成了即将改写格局的黑科技。9 月 2 日,独立研究者 Sebastian Raschka(《Build a Large Language Model From Scratch》作者)在博客上给出了技术评析:"循环变压器的想法,只是把变压器里的层拿来复用而已。"
Astra 可能确实是个好模型。但"循环"本身值不值得一个头条?把架构原理摊开看,这件事值得冷静拆解——而且拆完之后,你会发现真正值得关注的,是另一个问题。

原理一:标准变压器是一条固定的流水线
先建立直觉。大语言模型的本质工作,是猜下一个词。为了猜得准,它把你的文字变成一串数字(向量),然后让这串数字穿过一摞"数学加工层"(transformer layers),层层精炼,最后在最顶端吐出一个词。
关键在于:这条流水线是出厂时定死的。一个 18 层的模型,任何词、任何难度的题,都恰好走 18 道工序——每道工序配一台专属机器(那层自己的权重参数)。问"今天天气如何"和证明一道数学题,消耗的层数一模一样。这就是上左图标注的"固定次数"(fixed number of times)。
参数和层数是绑死的:想更深,就得造更多台机器,存储和显存跟着翻倍。这是大模型昂贵的根源之一。
原理二:循环深度 = 同一条流水线,跑两遍
循环深度的改法朴素得近乎"抠门":不留 18 台机器,只留 9 台,让流水线跑两圈。
上右图里那个粉色"循环块"(Recurrent block)就是这 9 台机器,箭头绕回去的意思是"再来一遍"。第一圈的输出,喂回同一组机器再炼一次。对模型来说,这近似于一个 18 层的网络——但仓库里只堆着 9 层的货。一句话:把两倍深的大脑,塞进一倍大的颅骨——代价是思考时多花一倍力气。
这不是纸面推演。开源模型 Nanbeige 4.2-3B(在 28 万亿 token 上从零预训练)就是把 22 层的层堆复用两次,等效 44 层。其技术报告的结论很冷静:两遍是最佳性价比,保留约 75% 的 token 效率;跑更多遍收益甚微,训练却贵得多。
参数量与存储
标准变压器: 随深度线性增长 循环深度(循环两圈): 仅存 1 份层权重,原地复用
每 token 计算量
标准变压器: 固定(L 层) 循环深度(循环两圈): 近乎翻倍(约 2L 层)
有效深度
标准变压器: 固定 L 层 循环深度(循环两圈): 近似 2L 层
难度自适应
标准变压器: 否,所有输入同深度 循环深度(循环两圈): 可,配合提前退出或路由
这不是新想法:一条 2019 年就铺好的路
Raschka 专门提醒:据他所知,Nanbeige 只是第一个采用此法的知名开源权重模型,想法本身早已存在。NeurIPS 论文《Mixture-of-Recursions》走得更远——加一个学习出来的"路由器",逐个 token 决定跑一遍、两遍还是更多遍:简单的 token 提前离场,困难的 token 加练几轮。像高速公路的 ETC 分流:小车提前下匝道,重卡多跑几圈再走。
而把这条路修到工程可用的,是 Google DeepMind 团队发表在 ICLR 2025 的《Relaxed Recursive Transformers》(arXiv:2410.20672)。这篇 49 页的论文回答了一个 Nanbeige 没回答的问题:不从头训练,能不能把现成的大模型直接"改装"成循环模型?
论文解读:三步把大模型"改装"成循环模型
第一步:抄权重。取原模型(Gemma 2B,18 层)前 9 层的权重存下来,前向传播时循环跑两圈——论文称之为 CYCLE 策略,连归一化参数也全部共享。直接开跑会掉分,于是只做少量"再训练"(uptraining)微调。
第二步:给每一圈发一张"小抄"。严格共享会伤性能——第 1 圈和第 2 圈的任务本该略有不同(先粗炼、再精炼),同一套权重却被迫一视同仁。解法是每个循环位置加一个低秩适配器(LoRA):体积极小的补丁,让两圈各有分工。论文用截断 SVD 从"原模型完整权重"与"共享权重"的残差里初始化这些补丁,LoRA 的秩可以调节,从"完全共享"平滑滑向"完全独立",两头兼顾。
第三步:让简单的词提前下车。配合提前退出(early exit),自信的 token 少跑几圈。论文还提出"连续深度批处理"(Continuous Depth-wise Batching),让不同请求的不同圈数在同一批次里动态拼车——模拟显示吞吐量可提升 2–3 倍,递归版 Gemma 的理论吞吐接近 4 倍。
"遮蔽思维链"的说法,只对了一半
回到那个最耸动的说法:循环架构会"遮蔽推理过程"。
Raschka 的判断是:层复用本身并不会隐藏思维链。循环层做的事和普通层完全一样——在吐出下一个词之前,把更多计算塞进隐藏状态(hidden states)里。它没有抹掉任何原本可见的文字。
合理的解读是间接的:循环次数多了,模型可能不再需要生成那么多中间推理 token——原本写出来给你看的草稿,变成了内部激活里读不出来的运算。但这不是循环架构的独门效应:把模型做大(GPT 5.6 Luna 变 Sol)会产生同样的现象。计算从"可读的文本"搬进"读不了的激活",是规模经济的副产品,不是某种阴谋开关。
值得注意的是,这篇论文的未来工作一节,标题就叫"通过循环深度实现潜在推理"(Latent Reasoning via Recurrent Depth)。学术圈两年前就看见了这条路通向哪里——如今它出现在 Astra 的传闻里。
Dehghani 等人对同一组层循环应用并配以动态停止机制,是参数共享与自适应深度的早期代表(经 arXiv:2410.20672 引述)
Google DeepMind 等团队提出把现成 LLM 改装为循环变压器的三步方法:权重初始化、LoRA 松绑与提前退出
最终版(v3)于 2025 年 2 月更新;Recursive Gemma 1B 以 600 亿 token 再训练追平全尺寸 Gemma 2B
指出循环变压器只是层复用;Nanbeige 4.2 为据其所知首个采用该思路的知名开源权重模型
循环变压器的想法,只是把变压器里的层拿来复用而已。(The looped transformer idea is just reusing layers in the transformer block.)
观点:三件值得记住的事
祛魅不等于否定。循环是个聪明的成本权衡:参数省一半、显存省一半、还能按难度变速。但它改变的是成本结构,不是智能的化学——别指望它单独解释 Astra 的任何基准奇迹。
可变深度才是真看点。同一个模型,简单请求快进快出、困难请求加练数轮——这给了"测试时算力"一个新旋钮。过去调算力靠换模型,未来可能只调圈数。
"看不见的思考"是真议题。无论 Astra 用不用循环,模型的推理正在从可读的文本迁往读不到的激活。今天审计 AI 靠读它的思维链;明天思维链可能只剩一个目录,正文锁在权重里。循环架构无罪,但它顺手把这扇门又推开了一条缝——监管和可解释性研究,得赶紧跟上。