TL;DR:系统研究了 Transformer 层间宽度分配问题。发现 × 形(两头宽中间窄)宽度轮廓一致优于等宽 baseline:200M–2B 密集模型 perplexity 低约 3%,3B MoE 同样胜出。训练 FLOPs 减少 22%,KV cache 减少 15%。核心设计:固定全局 residual 维度 + 参数无关的 slice 读写机制。
几乎所有 Transformer 都有一个不言而喻的假设:每一层的隐藏维度相同。GPT-3 96 层 × 12288 宽,Llama 32 层 × 4096 宽——选定一个隐藏维度后,每个 transformer block 获得的参数和计算预算完全相同。
这个设计很方便,但并不显然是最优的。不同层在网络中扮演的角色可能截然不同:浅层可能需要更大的宽度来处理原始 token 的丰富信息,深层可能需要更大的宽度来完成精细的输出分布,而中间层可能主要在做信息压缩和抽象。
这篇论文问了一个直接但被忽视的问题:在固定参数量和深度下,所有层都应该一样宽吗?
作者设计了四种非均匀宽度分配轮廓,用连续函数 cℓ 控制每层宽度:
在严格匹配参数量和深度的条件下,× 形轮廓一致胜出。作者将这种架构命名为 >former(因为 × 形像大于号 >)。
改变层间宽度不是简单的事。如果直接让不同层有不同的隐藏维度,residual connection 的维度就不匹配了——投影瓶颈会直接毁掉 skip path 的意义。
作者提出了一种参数无关的解决方案:保持一个固定的全局 residual 维度 D(等于最宽层的宽度),每个 block 只读写属于自己的一个 Dℓ 宽度的 "slice"。不被某个 block 使用的 residual 坐标直接通过拷贝跳过(零参数 bypass)。这意味着 block 之间的 residual stream 保持完整,不引入任何投影瓶颈。
这个设计被消融实验证明是关键——如果不用固定 residual 而是让每层自由改变 residual 维度,非均匀宽度的优势就消失了。
在 200M、500M、1B、2B 四个密集模型规模上,>former 一致优于等宽 baseline。perplexity 的相对改进约为 3%,且随着模型规模增大,优势保持稳定。
更值得注意的是,>former 在匹配参数量的前提下,平均层宽度低于 uniform baseline。因为 attention 的 FLOPs 随宽度线性增长(而参数量随宽度二次增长),这带来了直接的效率红利:
| 指标 | 改进幅度 |
|---|---|
| 训练 + 推理 FLOPs | -22% |
| KV cache 内存 + I/O | -15% |
| Perplexity(相对) | ~3% 更优 |
非均匀宽度分配对 MoE 架构同样有效。3B MoE 模型上,>former 在降低 FLOPs 的同时保持了更好的 perplexity。这表明 × 形宽度轮廓不是密集模型的偶然发现,而是 Transformer 架构中更普遍的优化方向。
分析部分给出了有说服力的解释。作者用 Participation Ratio(PR)衡量激活维度的有效利用率:
Neff = (∑ei)² / ∑ei²,其中 ei 是维度 i 的总能量。Neff / dℓ 就是宽度归一化的有效维度比例。
结果很清晰:uniform baseline 在大约第 10 层后,归一化 PR 坍缩到不到 5%——绝大部分维度变成废的,只有少数 outlier 维度承载所有数值能量。而 >former 的窄中间层维持了约 1000 个有效维度,利用率远高于 baseline。
瓶颈即正则化——中间层的窄宽度迫使网络把信息压缩到更少的维度里,形成更密集、更有效的表征。这和 autoencoder 瓶颈的直觉一致,但应用在 Transformer 层间宽度分配上,效果如此一致且稳定。
值得注意的是,这篇论文的发现和仅调整 FFN 中间维度的前人工作方向相反。Ikeda et al. (2025) 发现给中间层分配更多 FFN 计算量有好处,但本文显示当调整整个 transformer block 的宽度时,最优轮廓变成 × 形——中间反而更窄。这说明 FFN 维度调整和全 block 宽度调整的优化方向是不同的,不能简单推广。
论文承认几个局限:实验范围止步于 2B 密集 / 3B MoE,尚未验证更大规模;只测试了 decoder-only 语言模型,未涵盖 encoder-decoder 或视觉架构;宽度轮廓由连续函数参数化,最优形状可能更复杂。
工程意义上,>former 的最大吸引力在于它的零架构风险:不改 attention 机制、不改 FFN 结构、不改训练流程,只是调整每层的维度分配。几乎零代价的改动,换来一致的 perplexity 改进和 22% FLOPs 节省。
对于正在做模型架构设计或蒸馏的团队,× 形宽度轮廓值得作为默认选项测试。尤其是 KV cache 的 15% 节省,对长文本推理场景有直接的商业价值。
这篇论文的核心贡献不是提出了什么复杂的新架构,而是系统性地打破了一个被忽视的默认假设。>former 用简洁的实验设计证明:非均匀宽度分配不仅可行,而且在多个规模上稳定优于 uniform baseline。性能更好、计算更省、KV cache 更小——这种"重新审视基本设计选择"的工作,往往比堆砌复杂技巧更有长期价值。