港中文提出Pion优化器:在等谱流形上旋转权重,无需归一化层解决大模型训练失稳
2026/05/31
大模型训练为什么会在百亿参数规模之后越来越难稳定
当模型参数规模向百亿、千亿迈进时,两个问题开始主导训练工程的关注:训练稳定性,以及超参数从小模型到大模型的迁移能力。
稳定性问题的具体表现包括:注意力logits在训练中持续增大、激活输出范数逐步漂移、深层网络中损失尖峰频繁出现,严重时引发数值溢出和训练崩溃。目前主流的应对方式分两类:一类是打补丁——梯度裁剪、激活截断、学习率衰减等,直接抑制数值爆炸;另一类是加入归一化结构(BatchNorm/LayerNorm)或依赖μP(Maximal Update Parameterization)等尺度化框架进行约束。
香港中文大学等机构提出的Pion优化器论文的出发点是:这两类应对都没有触及根源。根源在于优化器的更新方式本身——加法更新会改变参数矩阵的奇异值分布(谱几何),一旦谱几何被破坏,深层网络的训练动力学就会失稳。
Pion的做法:把"谱保持"写进优化器
Pion的核心思路是在等谱流形(isospectral manifold)上执行参数更新。"等谱流形"是指权重矩阵奇异值保持不变的约束空间——在这个空间里更新参数,不会改变参数矩阵的谱几何。
具体实现上,Pion通过旋转权重矩阵(而非加法更新)完成梯度方向的参数调整,保证每次更新前后权重矩阵的奇异值分布不变。这样做的直接效果是:即使去掉归一化层,即使在超深层网络结构中,训练过程也能保持数值稳定。论文在不加任何归一化层的条件下验证了Pion的稳定性——这是传统优化器(AdamW、Muon)明显无法处理的极端情形。
论文还在预训练、监督微调(SFT)和强化学习(RL)三类任务上验证了Pion,均表现出更优的稳定性和泛化性。
超参数可以直接从小模型迁移到大模型
Pion解决的第二个问题是超参数跨规模迁移。传统优化器中,小模型上调好的超参数(学习率、权重衰减等参数)通常不能直接用于更大规模的模型,每个规模需要重新搜索——代价高昂,是大规模训练的实际工程瓶颈。
Pion的等谱约束使参数更新的尺度在不同模型规模下保持一致性。论文指出,这种一致性使超参数无需重新搜索即可从小规模模型迁移至更大规模模型。这一特性此前依赖μP等额外框架才能部分实现,Pion将其内嵌进优化器本身。
与现有方案的区别
与现有"补丁式"方案相比,Pion在以下维度有所不同:
- 归一化层不再必须:传统深层网络通常依赖LayerNorm维持训练稳定,Pion在去掉归一化层的条件下仍能稳定训练
- 不依赖额外尺度框架:μP需要在参数初始化和更新规则上引入额外约束,Pion通过优化器内部机制实现等效甚至更好的迁移能力
- 三类任务均验证:预训练、微调、强化学习全链路验证,不局限于单一训练阶段
需要注意的边界:论文目前报告的验证规模上限尚未明确公开,万亿参数规模下的实测数据尚未出现。此外,等谱流形更新相比加法更新的计算开销,论文尚未给出系统性对比数据。