核心贡献:Layer-loop(层级循环)替代传统 Model-loop(模型级循环),配合 MoE 架构和计算匹配的扩增配方,Loopie-20B-A2B 在同等训练时间下全面超越 Qwen3-30B-A3B、gpt-oss-20B 等非循环基线,并在 IMO 2025 和 IPhO 中无需工具达到金牌水平。
2019年,Dehghani等人提出Universal Transformer时,核心idea干净利落:与其堆48层不同的参数,为什么不让同一组参数反复运行?循环Transformer的承诺是——计算深度可以远大于存储深度,参数效率的天花板被打开。
但过去几年的事实很残酷。给定相等的计算预算,增参数N倍的非循环模型,几乎总是吊打循环N次的模型。Ouro、Huginn等代表性工作在参数效率上有亮点,但在大模型尺度上始终无法正面竞争。
这里有一个微妙的陷阱。循环Transformer的优势通常用"参数效率"来宣传:达到同样性能需要更少参数。但参数效率并不自动转化为计算效率。在大规模预训练中,计算预算才是真正的硬约束。循环架构减少了存储参数,却增加了执行FLOP——而在现代GPU上,FLOP通常不是瓶颈,显存才是。
Loopie的团队抓住了一个关键的洞察:循环Transformer真正的优势不在参数效率,而在显存效率。存储层数减半意味着激活内存减半,省下的显存可以投资到更大的microbatch或更宽的hidden dim上。这才是正确的跑道。
说到循环Transformer,直觉上都会想"把整个模型跑两遍"。这也确实是之前所有工作的做法——先走完整个layer stack,输出再喂回去,再来一遍。Loopie把这种模式称为model-loop。
Loopie的做法是layer-loop:每一层自己先循环R次,然后才把结果传给下一层。
这个"把循环从外圈挪到内圈"的改动,物理意义远大于形式差异:
梯度冲突的根源被削弱了。 在model-loop中,同一组参数要在第1层(刚读到输入的浅层状态)和第48层(已经推了好几轮的深层状态)之间反复横跳。功能需求差异巨大,梯度方向经常打架。layer-loop把重用限制在相邻depth位置,参数面对的"功能身份"更一致,优化路径更干净。
基础设施更友好。 同一层的多次应用在计算图中相邻出现,激活检查点和梯度累积的开销显著降低。前向和后向计算中的参数复用距离缩短,缓存命中率提高。
可扩展性更好。 实验发现,model-loop在训练早期(约前1T token)略优于layer-loop,但在~1.2T token处被反超,之后差距持续扩大。如果你只训几个B token就下结论,model-loop看起来更好。但大规模预训练拼的是后期——lay-loop在这个维度上赢得很清楚。
Loopie的另一项核心贡献是一套compute-matched scaling recipe。它的逻辑链条异常清晰:
① 从参考模型出发。假设计算预算刚够训练一个Qwen3风格的30B-A3B模型(48层,hidden dim=2048)。
② 构建循环种子。把存储层数从48砍到24,循环次数R=2。总Transformer block执行次数不变(24×2=48),但激活内存直接减半。
③ 挥霍省下的内存。激活内存少了,microbatch可以翻倍,gradient accumulation步数减半。把省下的效率投资到更大hidden dim和更多层——Loopie-20B-A2B最终选择了2432维度、28层、R=2的配置。
④ 匹配的是端到端wall-clock时间,不是理论FLOP。 这是整个方法论的关键。Loopie的理论FLOP实际上比非循环基线更高(多出的计算来自循环的额外开销),但更高的显存效率和microbatch利用率完全抵消了这一点。不管FLOP怎么算,如果两台机器花一样的时间训练,Loopie的结果更好——这才是诚实的比较。
下面的表格来自论文Table 1,展示了从参考配置到候选Loopie配置的搜索空间:
| 配置 | D | L | R | 计算代理 | 激活内存代理 |
|---|---|---|---|---|---|
| Qwen3 30B-A3B | 2048 | 48 | 1 | 1.00× | 1.00× |
| Seed Loopie | 2048 | 24 | 2 | 1.00× | 0.50× |
| Loopie候选1 | 2176 | 25 | 2 | 1.18× | 0.55× |
| Loopie候选2 | 2304 | 27 | 2 | 1.42× | 0.63× |
| Loopie候选3 | 2432 | 28 | 2 | 1.65× | 0.69× |
最终选定的是候选3——计算代理1.65×(理论FLOP多了65%),但端到端训练时间与参考模型持平。
Loopie-20B-A2B(20B总参数,2B活跃参数)的关键benchmark如下:
| Benchmark | Loopie-20B-A2B | Qwen3-30B-A3B | gpt-oss-20B | Nemotron-30B-A3B |
|---|---|---|---|---|
| AIME | 92.10% | 90.10% | 85.00% | 88.33% |
| AMC | 94.21% | — | 91.05% | 91.80% |
| OlympiadBench | 80.50% | 76.68% | 70.03% | 81.20% |
| IFEval | 84.72% | — | 70.64% | 79.21% |
| ARC-Challenge | 93.52% | — | 92.42% | 93.86% |
| MMLU-Redux | 83.61% | — | 83.40% | 83.89% |
最震撼的不是某个单项,而是全面领先。数学推理(AIME 92.1%)、竞赛数学(AMC 94.2%)、指令跟随(IFEval 84.7%)——三个维度上Loopie都压制了所有等计算预算的对比模型。
在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)上,Loopie-20B-A2B在没有使用任何外部工具(无代码执行、无搜索、无验证器)的条件下达到金牌水平。对循环架构来说,这是一个分水岭式的信号。
一个直觉性的问题是:如果R=2比R=1好,那R=3、R=4会不会更好?
Loopie团队做了大量消融实验,结论明确:R=2是最优选择。 R=3时,额外的循环步带来的收益不足以覆盖训练开销。而且,R=2的优势在大规模上持续成立——不是过拟合,是真的最优。
这背后的直觉可能是:两轮循环已经足够让每层完成"局部迭代精炼",更多轮反而因为梯度传播路径过长而引入噪声。循环Transformer不是越循环越好——有一个甜点区。
循环Transformer的甜点不是R→∞(固定点迭代),也不是R=1(普通的非循环Transformer)。R=2在模型容量、训练稳定性和计算效率之间找到了最优平衡。
Loopie的强大推理能力不仅来自预训练架构,也来自一套精心设计的后训练流水线:
监督预训练(SPT):在大规模高质量数学和科学语料上进行多轮SFT。论文中特别提到了一套基于难度筛选和响应质量的数据构建策略。
强化学习:在SPT基础上进行RL微调,使用了专门的推理奖励信号。团队没有披露完整的RL配方细节,但从最终效果来看,RL阶梯对数学和物理推理的增益是实质性的。
后训练的投入不小——没有它,再好的架构也只是"有潜力的预训练模型"。但架构决定天花板,后训练决定离天花板多近。Looped架构给了更强的预训练信号,后训练才能把推理能力推到这个水平。
Loopie的工程意义远不止"又一个推理模型"。
第一,重新定义了效率和容量的关系。 传统思路是"要更多推理能力→堆更多层→买更多GPU"。Loopie说:把已有的层多用一次,省下的显存投资到宽度上。这是同一台机器上提高能力上限的路径——对于受限于硬件预算的团队来说,这是实打实的价值。
第二,MoE + 循环是天然搭档。 MoE负责容量扩展(更多专家),循环负责深度扩展(更多计算步)。两者各司其职、不互斥。Loopie证明了这两个方向可以叠加,且叠加后的效果大于单独使用。
第三,layer-loop是正确范式。 把循环从模型级下放到层级,可能是循环Transformer真正规模化落地的钥匙。之前的所有循环Transformer工作(Ouro、Huginn等)都使用model-loop——Loopie的消融实验表明,这可能就是它们在大规模上不敌非循环基线的原因。
循环Transformer过去输掉的计算匹配之战,原因不是"循环不好",而是"循环放错了位置"。
Loopie也有一些需要注意的边界条件:
只验证了R=2。 论文聚焦于R=2的场景,对更高循环次数的讨论不够深入。R>2是否在某些特定领域(如代码推理、长文本理解)中有价值,仍然是一个开放问题。
推理时的循环开销。 虽然训练效率优于非循环基线,推理时循环R次仍然意味着更高的延迟(虽然可以通过流水线优化)。在实时性要求高的场景下,这可能成为瓶颈。
后训练配方未完全公开。 SPT和RL的具体细节、数据构成和超参没有完全披露,社区复现可能存在gap。好在megatron-loopie和vllm-loopie都已开源。
Layer-loop是否适用于所有架构? 论文在MoE架构上做了充分验证,但在dense模型上的表现需要更多实验来确认。
尽管如此,Loopie在"循环Transformer能否在大规模预训练中击败非循环基线"这个核心问题上,交出了一份令人信服的答卷。如果LOTUS证明了循环架构在推理效率上的价值,那Loopie就是第一个用计算匹配的公平比较证明循环架构可以在预训练中赢的工作。
循环Transformer近年来的进展快速。以下是与Loopie直接相关的关键工作:
| 论文 | 核心贡献 | 与Loopie的关系 |
|---|---|---|
| Universal Transformer (Dehghani+ 2019) | 首次提出循环Transformer | 架构祖先 |
| ALBERT (Lan+ 2020) | 跨层参数共享 | model-loop变体 |
| Ouro (Zhu+ 2025) | 现代大规模循环LM | model-loop方法;Loopie做了直接对比 |
| Huginn (Geiping+ 2025) | 循环+位置编码创新 | model-loop方法;Loopie做了直接对比 |
| LOTUS (Gao+ 2026) | 循环+隐式CoT推理 | 互补方向:LOTUS聚焦推理效率,Loopie聚焦训练效率 |
| LoopRPT (Tang+ 2026) | 循环路径上的RL监督 | 后训练方法的潜在互补 |