【今日大模型微调速递】LeLoRA:ACL 2026 重磅提出可学习的低秩适配框架,让模型自己决定该微调哪些参数
ACL 2026 长文收录:LeLoRA 用强化学习策略网络让 LoRA 从「固定超参」走向「自适应学习」,在 10 个 LLM(125M-70B)上全面超越 LoRA/DoRA 基线,参数效率更高且不增加推理延迟。
在参数高效微调(PEFT)领域,LoRA(Low-Rank Adaptation)自 2021 年提出以来一直是事实标准。它的核心思想简洁而优雅:将权重更新限制在低秩子空间,用极少的可训练参数实现接近全量微调的效果。但一个长期以来被忽视的问题是——秩应该选多少?哪些权重矩阵的哪些维度最值得训练? 这些问题一直依赖人工经验和繁琐的消融实验来回答。
ACL 2026 长文 LeLoRA(Learnable Low-Rank Adaptation) 首次系统性地解决了这一难题。该工作由 Xiaoling Zhou、Mingjie Zhang、Zhemg Lee、Wei Ye 和 Shikun Zhang 共同完成,发表于第 64 届 ACL 年会(美国圣地亚哥)。论文提出了一个全新的框架:让模型在微调过程中自动学习每个权重矩阵中哪些参数应该被训练,而不是依赖人工预设的固定秩。
核心方法:策略网络 + 强化学习驱动的自适应微调
LeLoRA 的架构设计非常巧妙。它在 LLM 之外引入了一个轻量级的策略网络(Policy Network),该网络会分析每个权重矩阵的数学特性——包括奇异值分布和矩阵范数——然后为每个矩阵动态生成一个"适配策略",指明哪些维度应该被纳入可训练集合。整个系统通过强化学习优化算法进行迭代更新,LLM 和策略网络在训练中协同进化。
这意味着:在微调开始时,策略网络可能认为某些层的奇异值衰减较快,只需要训练少数主导维度;随着 LLM 参数的演化,策略网络会实时调整判断,动态增减各层的可训练参数。整个过程无需人工介入,完全由强化学习的奖励信号驱动。
论文的实验覆盖范围令人印象深刻——在 10 个不同规模的 LLM 上进行了验证,从 1.25 亿参数的小模型到 700 亿参数的大型模型。在常识推理基准测试(BoolQ、PIQA、SIQA、HellaSwag、WinoGrande、ARC-e、ARC-c、OBQA 共 8 个任务)上,LeLoRA 取得了全面领先:
| 模型底座 | LoRA (r=32) | DoRA (r=32) | LeLoRA (max_dim=32) | LeLoRA (max_dim=64) |
|---|---|---|---|---|
| LLaMA-13B | 80.5 | 81.5 | 82.8 | 83.1 |
| LLaMA2-13B | 83.2 | 83.4 | 85.3 | 86.1 |
(数据来源:LeLoRA 论文 Table 9,8 项常识推理任务平均分)
三大关键发现
第一,参数效率远超基线。 当 LeLoRA 的最大有效维度设为 128、LoRA 的秩设为 32 时,两者可训练参数量大致相当——但 LeLoRA 的表现显著领先。论文的实验进一步显示,LeLoRA 用更少的可训练参数就达到了比 LoRA 和 DoRA 更好的效果。
第二,不同"位置"的参数重要性不同。 论文将权重矩阵中的维度按位置分为"主要位"“次要位"和"中等位"三类。实验表明,同时在这三类位置配置可训练参数,效果远优于只训练单一位置——这验证了 LeLoRA 策略网络多维度决策的合理性。
第三,零推理延迟。 与 LoRA 一样,LeLoRA 在训练完成后可以将适配器权重合并回基础模型,推理阶段完全不引入任何额外延迟。这是相对于其他 PEFT 变体的关键工程优势。
商业启示:让微调从「手工调参」走向「自动适配」
LeLoRA 的核心洞察与思陌的业务方向高度契合:
- 基座模型微调:传统 LoRA 的秩选择一直是工程痛点——客户往往要为不同场景反复做消融实验来确定最佳秩。LeLoRA 的自适应策略直接消除了这一环节,让模型自己决定"该学什么”,大幅降低了微调的试错成本。
- 领域适配训练:对于金融、法律、制造等专业领域,不同层的知识密度差异很大。LeLoRA 的矩阵级自适应恰好能在知识密集的层分配更多学习能力,在通用层保持轻量。
- 推理部��服务:零推理延迟的特性意味着 LeLoRA 微调后的模型可以直接复用现有的 vLLM/TensorRT-LLM 推理管线,无需任何额外适配。思陌可将其无缝集成到客户现有的部署架构中。
从产业视角看,LeLoRA 标志着 PEFT 技术正在从"一套参数手动适配所有场景"进化到"每层、每矩阵、每任务自动最优配置"的新阶段。对于有大量微调需求的企业客户,这意味着更低的 GPU 消耗、更快的迭代速度、更好的微调效果——三者兼得。
参考文献
- LeLoRA: Learnable Low-Rank Adaptation of Large Language Models. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Volume 1: Long Papers), pp. 35255–35273. Zhou, X., Zhang, M., Lee, Z., Ye, W., & Zhang, S., 2026.
- LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. Hu, E. J., Shen, Y., Wallis, P., et al., 2021.
- DoRA: Weight-Decomposed Low-Rank Adaptation. ICML 2024. Liu, S.-Y., Wang, C.-Y., Yin, H., et al., 2024.