← 行业趋势
多个LoRA适配器如何自动协同?LoGo无需训练即可实例级动态选择与合并

多个LoRA适配器如何自动协同?LoGo无需训练即可实例级动态选择与合并

ACL 2026 提出 LoGo 框架,通过单次前向传播信号实现训练免费的 LoRA 适配器动态选择与合并,在 5 个 NLP 基准、27 个数据集、3 个模型家族上性能提升最高 3.6%,且保持推理吞吐量不变。

封面

低秩适配(LoRA)已成为大模型参数高效微调的事实标准。一套基础模型搭配几十个 LoRA 适配器,即可覆盖从情感分析到代码生成等多种下游任务。然而一个关键工程问题悬而未决:当输入属于多个任务域时,如何自动选择合适的 LoRA 适配器组合?

现有方案要么要求额外标注数据训练路由模块,要么在推理时对每个适配器单独执行前向传播后做后验选择,计算开销随适配器数量线性增长。在真实部署中——尤其是思陌大模型微调服务的客户场景——任务边界往往是模糊的,输入可能同时涉及知识问答、摘要和风格控制,不可能要求客户预先打标签。

来自 ACL 2026 的 LoGo(LoRA on the Go) 给出了一个优雅的解答。

核心方法:单次前向传播就够了

LoGo 的设计哲学极为务实——不增加额外训练、不要求标注数据、不牺牲推理吞吐。整个框架由两个核心组件构成:

① 适配器信号提取。 LoGo 假设每个 LoRA 适配器在其专长任务上会产生更强的激活响应。当一条新输入到来时,LoGo 将其送入所有候选 LoRA 适配器执行一次前向传播,从中间层激活中提取每个适配器的"任务相关性信号"。这个信号本质上反映了该适配器对当前输入的敏感程度。

② 实例级动态合并。 基于提取的信号,LoGo 即时决策该合并哪些适配器、以及各自的贡献权重。合并后的复合适配器直接替代单一 LoRA 进行推理,整个过程不引入额外的前向传播开销——因为信号提取已经"夹带"在正常推理的必经路径中。

关键在于:信号提取利用了 LoRA adapter 本身极轻量的特性(通常只有基座模型参数的 0.1%~1%),额外计算几乎可以忽略。论文实验显示,LoGo 在吞吐量上与单适配器推理持平。

实验结果:27 个数据集的全面验证

论文在 3 个模型家族(LLaMA、Mistral、Gemma)上评估了 5 个 NLP 基准(包括 MMLU、BBH、GSM8K 等),覆盖 27 个数据集。与三类现有方法对比:

方法 需要训练 需要标注数据 平均性能
单适配器(最优) 基线
训练路由(如 LoRAHub) +1.2%
加权平均合并 +0.8%
LoGo(本文) +3.6%

LoGo 在部分任务上相较训练类方法提升达 3.6%,在其他任务上保持竞争力,且全程无需训练、无需标注数据。这是第一个在训练免费前提下超越训练基线的 LoRA 动态路由方法。

商业启示:大模型微调服务的"最后一公里"

对思陌大模型微调业务而言,LoGo 的方向直击客户痛点:

领域适配的工程简化。 当前微调服务通常为一个客户训练一套专用 LoRA。如果客户业务线扩展(例如从合同审查延伸到合规问答),传统做法需要重新训练或小心翼翼地做多 LoRA 手工合并。LoGo 提供了一条自动化路径:训练多个领域专用的轻量适配器,推理时自动按输入类型组合。

推理部署的效率增益。 思陌的推理部署服务(capabilities/inference-deploy)目前以单一适配器为主。若引入 LoGo 的多适配器动态合并,一次部署即可覆盖多场景,减少模型实例数和服务切换开销——从商业角度,这意味着降低客户的单位推理成本、提高服务吞吐。

但需要指出不足: LoGo 当前仅在英文 NLP 任务上验证,中文环境下的适配器信号分布可能与英文存在差异;27 个数据集的覆盖范围以学术基准为主,离真实业务场景还有距离。这些是我们后续技术评估需要关注的方向。

参考文献

  1. Lee S, Das S, Gupta M, Gummadi KP. LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging. In: Proceedings of ACL 2026. DOI: 10.18653/v1/2026.acl-long.1837

📄 论文原文信息

论文标题LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging
作者Seungeon Lee, Soumi Das, Manish Gupta, Krishna P. Gummadi
期刊ACL 2026
发表时间2026-07
DOI10.18653/v1/2026.acl-long.1837