← 行业趋势
LoRA 微调如何让优化器真正尊重低秩几何?LoRA-TSD 切空间谱下降优化器解析

LoRA 微调如何让优化器真正尊重低秩几何?LoRA-TSD 切空间谱下降优化器解析

标准 LoRA 的两个因子 A、B 各自独立训练,更新会忽略它们相乘后诱导出的低秩权重变化的几何结构。LoRA-TSD 把每步 LoRA 更新当作固定秩矩阵流形上的切向量,在切空间内执行 Muon 式的谱范数最速下降,再通过原生 retraction 映射回因子——retraction 成本比此前的截断 SVD 方法便宜 2.8 倍,并在 Llama-3.2-1B、Llama-3.1-8B、Qwen3-32B 三档模型、六项常识推理与 NLI 基准上全面超越现有 LoRA 优化器,且对适配器秩保持鲁棒。

自 Hu 等人 2021 年提出 LoRA 以来,参数高效微调(PEFT)的竞争焦点大多集中在"怎么初始化"上——从 PiSSA、DoRA 到上个月的 NoRA,各家都在 A、B 两个低秩因子的初始状态上做文章。但一个更根本的问题长期被忽视:该用什么优化器来训练 LoRA? 2026 年 9 月 2 日,Dmitrii Andriianov、Andrey Veprikov、Aleksandr Beznosikov 在 arXiv 提交论文《LoRA-TSD: Tangent-Space Spectral Descent for LoRA via Muon-Style Updates》(arXiv:2609.02734),直指标准 LoRA 的一个结构性缺陷:A、B 两个因子各自独立训练,更新方向完全忽略了它们相乘之后诱导出的低秩权重变化的几何结构

封面

核心方法:把优化器搬进低秩矩阵流形

LoRA 把权重更新写成 ΔW = B·A,真正有意义的对象是 ΔW 这个低秩矩阵,而不是单独的 A 或 B。问题在于:用标准优化器(Adam/AdamW)分别更新 A 和 B,等价于在"因子空间"里各走各的步,二者叠加后落在流形上的方向,往往不是 ΔW 上最陡的下降方向——换句话说,优化器在参数空间里走对了,在低秩流形上却走歪了

LoRA-TSD 的解法是让优化器"回到流形上思考"。它的每一步分三步走:其一,把当前 LoRA 更新视作固定秩矩阵流形上的一个切向量;其二,在这个切空间内执行 Muon 式的谱范数最速下降(spectral-norm steepest descent)——Muon 是 2025 年起在 LLM 训练中走红的正交化优化器,擅长用谱信息校正更新方向;其三,用一个"原生"于 LoRA 参数化的 retraction(回缩映射) 把切空间里的更新干净地映射回 A、B 因子。

技术原理

这里有两个关键的工程细节决定了它的实用性。第一,整个更新过程避开了对完整权重矩阵的昂贵操作,计算开销被控制在 LoRA 的量级内;第二,这个原生 retraction 比此前流形类方法普遍采用的截断 SVD retraction 便宜最多 2.8 倍。别小看这个数字——流形优化方法此前"理论漂亮、工程昂贵"的尴尬,很大程度上就卡在每步都要做 SVD 上,LoRA-TSD 用更便宜的回缩映射把这个瓶颈大幅削弱了。

理论补强:首次给出全局收敛保证,并把 LoRA-Pro 统一进来

论文的理论贡献同样扎实。作者证明,其代理目标在 Frobenius 范数版本下可以精确恢复出 LoRA-Pro——这意味着 LoRA-Pro 其实是 LoRA-TSD 框架的一个特例,之前彼此独立的方法被统一进了同一套流形语言里。

更有价值的是对"收敛判据"的重新定义。作者指出,LoRA 训练最自然的驻点度量,不是因子梯度范数,而是切投影梯度(tangent-projected gradient)——也就是流形上的黎曼梯度,而且它仅凭 A、B 的因子梯度就能算出来。在这个度量下,论文首次给出了 LoRA-Pro 与 LoRA-TSD 的全局收敛保证,收敛速率能驱动因子梯度范数趋于零。对工程团队而言,这提供了一个此前缺失的理论抓手:LoRA 训到什么程度算"收敛",从此有了明确的判据。

实验结果:三档模型、六项基准全面领先,且对秩鲁棒

作者在三个模型尺度(Llama-3.2-1B、Llama-3.1-8B、Qwen3-32B)上,覆盖六项常识推理与自然语言推理(NLI)基准进行了系统对比。结论干净利落:LoRA-TSD 全面超越所有参与对比的 LoRA 优化器,并且对适配器秩(rank)的选择保持鲁棒——这一点尤其重要,因为标准 LoRA 的效果对 rank 高度敏感,秩选小了性能掉、选大了显存涨,LoRA-TSD 的"对秩鲁棒"意味着交付时不必在 rank 调优上反复折腾。论文共 29 页、3 图、8 表,代码已在 GitHub 开源(brain-lab-research/LoRA-TSD)。

实验结果

商业启示:一个带收敛保证、且更省算力的 LoRA 优化器

这篇论文对思陌大模型微调的价值,落在"优化器选型"这个此前被默认值掩盖的环节。在基座模型微调领域适配训练两条线上,团队几乎默认 Adam/AdamW,而 LoRA-TSD 提供了一个 retraction 更便宜、且自带全局收敛保证的替代选项,能在不增加显存的前提下抬升 LoRA 训练的上限;由于它仍是纯 LoRA 形式、增量权重可合并回原模型,推理部署零开销,与思陌现有的量化部署链路完全兼容。更进一步,Muon 式"用谱信息校正更新方向"的思想,也可以迁移到指令微调与对齐(GRPO/RLHF)场景的优化器选型中——当客户对收敛速度和稳定性有明确指标要求时,这比"换个初始化"更有说服力。一句话总结:LoRA-TSD 证明,后训练里被长期忽略的"优化器几何"同样藏着确定性增量,值得思陌纳入交付基线评估。

参考文献

📄 论文原文信息

论文标题LoRA-TSD: Tangent-Space Spectral Descent for LoRA via Muon-Style Updates
作者Dmitrii Andriianov, Andrey Veprikov, Aleksandr Beznosikov
期刊arXiv (cs.LG)
发表时间2026-09-02
DOI10.48550/arXiv.2609.02734

论文原文信息地址:https://www.simolm.com/blog/2026-09-04-lora-tsd-tangent-space-spectral-descent/