← 行业趋势
LoRA 微调为什么收敛慢、还伴随灾难性遗忘?NoRA 归一化低秩适配方法解析

LoRA 微调为什么收敛慢、还伴随灾难性遗忘?NoRA 归一化低秩适配方法解析

LoRA 因把上投影 B 初始化为零,早期优化几乎全由随机初始化的下投影 A 主导,而随机 A 的列范数远小于 1 且分布不均,导致有效学习率被严重压制——研究者称之为可学习性缺口;提出的 NoRA 仅对 A 做列归一化,在 Llama 3.2-3B 四项基准上把 SFT 平均分从 37.93 提到 43.37,且零额外参数、零推理开销,同时缓解灾难性遗忘。

自 Hu 等人 2021 年提出 LoRA 以来,它几乎成了参数高效微调(PEFT)的代名词:冻结预训练权重,只训练两个低秩矩阵 A、B 的乘积,训练开销骤降、推理时又能把增量权重合并回原模型。但一个长期被忽略的问题是——LoRA 的训练动力学到底该怎么"调稳"?2026 年 8 月 31 日,来自元石智能(Yuan Shi Intelligence)、微软研究院和香港中文大学的 Jiale Kang、Ziyin Yue、Zheng Zhan、Yangyi Huang、Weiyang Liu 团队在 arXiv 提交论文《Normalized Low-Rank Adaptation》(arXiv:2608.31036),指出 LoRA 在初始化层面存在一个被长期忽视的"梯度病",并给出了一个简单到几乎白送的解法——NoRA。

封面

核心方法:问题出在 A 的初始化上

要理解 NoRA,得先看清 LoRA 的初始化到底做了什么。标准 LoRA 把权重更新写成 ΔW = B·A,其中上投影 B 被初始化为零、下投影 A 随机初始化。由于 B 是零,训练早期的梯度信号几乎全部流向 A——换句话说,A 的初始化状态,基本决定了整个早期训练轨迹

问题恰恰出在 A 的初始状态。论文用一个前置条件(preconditioning)的视角做了精妙拆解:LoRA 的优化过程,等价于"全参数微调"乘上一个前置条件矩阵 P = α²AᵀA,而 P 的对角元,就是每个输入维度对应的有效学习率。对随机初始化的 A 来说,它的列范数远小于 1,且列与列之间差异巨大——结果就是有效学习率被普遍压低、又分布极不均匀,梯度范数远低于全参数微调,最终表现为收敛慢、训练不稳定。作者把这一现象命名为 “可学习性缺口”(learnability gap)

NoRA 的解法则直白得近乎朴素:对 A 做列归一化,让每一列都拥有单位 L2 范数。这个灵感来自 MLA 中使用的潜在归一化。但这里有一个关键细节——LoRA 不能直接照搬"归一化 Ax"的做法,因为那样会引入非线性、导致推理时无法把增量权重合并回原模型。NoRA 的聪明之处在于:它把归一化直接作用在矩阵 A 上、与输入 x 无关,从而保持整个操作线性。训练结束后,B·Norm(A) 依然可以合并回原模型,实现零推理开销

技术原理

论文给出了两种变体:Continuous NoRA 在每一步都做归一化;NoRA-init 只在初始化时归一化一次、之后让 A 自由更新。后者是纯粹的即插即用替代——只需在初始化阶段改一行代码,就把 SFT 平均分从 37.93 提到 42.38,涨了近 5 分。此外还有一个更简单的初始化策略 BIMI:直接把 A 构造成分块单位矩阵,让列天然具备单位范数,连单独的归一化步骤都省了。论文还指出,MiSS 可以视为 NoRA 的一个特例,且同样的归一化原理可以原样套到 DoRA 上。

实验结果:一行改动,全面反超一票复杂初始化

作者在三个场景上验证了 NoRA,结论一致且相当干净。在**监督微调(SFT)**场景下,用 Llama 3.2-3B 在 GSM8K、Math500、HumanEval、MBPP 四项基准上评测,NoRA 平均 43.37 分,标准 LoRA 仅 37.93 分,而 PiSSA、DoRA、RSLoRA 这些早已成名、各有精巧设计的初始化方法,全部被这个"只加了一行列归一化"的变体压了下去。

预训练场景里,差异更直观:标准 LoRA 在 MHA 架构下、使用小秩(small rank)设置时会出现性能崩塌,在 LAMBADA 上尤其明显;而 NoRA 保持稳定,梯度量级始终和全参数微调保持在同一数量级。真正的亮点在强化学习(RLVR)场景——用 DeepSeek-R1-Distill-Qwen-1.5B 做强化学习时,依赖权重 SVD 分解的 PiSSA 干脆完全不收敛,而 NoRA 稳稳跑完全程,且持续优于基座模型。作者据此强调:起决定作用的不是权重谱结构,而是优化几何

实验结果

灾难性遗忘同样得到缓解。SFT 之后,标准 LoRA 在 MMLU 和 AGIEval 上会出现明显掉分,而 NoRA 不仅没有掉分,部分子集甚至略有回升。综合看,整个方法的核心改动只需几行代码,零额外参数、零推理开销,却把一票复杂的初始化方法比了下去(详见 arXiv:2608.31036 正文)。

商业启示:一行代码,让 LoRA 交付稳涨五个点

这篇论文对思陌大模型微调的价值,是那种"立刻就能用"的落地价值。在基座模型微调领域适配训练两条线上,NoRA-init 是纯粹的即插即用:不用改训练流程、不引入新参数、推理零开销,只需在初始化时对 A 做一次列归一化,就能在客户交付的 LoRA 方案上稳定回收约 5 个点的 SFT 收益。对思陌给中小客户做"低成本微调"的典型场景来说,这种"零成本确定性增量"是最有说服力的交付语言。

指令微调与对齐线上,NoRA 在 RLVR 场景里"PiSSA 不收敛、NoRA 稳定收敛"的对比,则揭示了一个更深的工程判断——强化学习微调里,真正决定成败的是优化几何而非权重谱,这提示我们在给客户上 GRPO/RLHF 时,初始化与训练动力学的调优可能比换方法本身更关键。而灾难性遗忘的缓解,又直接回应了领域适配训练(CPT)里客户最担心的"学了新行业、忘了老本事"的痛点。一句话总结:NoRA 用一行代码证明,后训练里还有很多"白捡"的增量,值得思陌第一时间纳入交付基线。

参考文献

📄 论文原文信息

论文标题Normalized Low-Rank Adaptation
作者Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu
期刊arXiv (cs.LG)
发表时间2026-08-31
DOI10.48550/arXiv.2608.31036

论文原文信息地址:https://www.simolm.com/blog/2026-09-02-nora-normalized-low-rank-adaptation/