CARE:让每个 Token 按需分配专家预算,MoE-LoRA 推理效率新范式
提出置信度自适应路由机制 CARE,利用路由器 softmax 分布作为逐 token 不确定性信号,nucleus 式动态分配专家数量,匹配固定 top-k 基线精度同时减少专家激活,且零额外参数、单次前向传播即可同时获得 OOD 检测信号。
研究背景:MoE-LoRA 的"一刀切"困境
混合专家 LoRA(MoE-LoRA)已成为大模型高效微调的主流范式之一。其核心思想是将多个 LoRA 适配器作为"专家",通过路由器为每个 token 选择 k 个专家参与计算。这一设计在常识推理、数学、代码等多任务场景中展现出了显著优于单一 LoRA 的表达能力。
然而,现有 MoE-LoRA 方法存在一个隐蔽但致命的效率问题:所有 token 被分配相同数量的专家。无论是模型高度自信的简单 token(如介词、标点),还是充满歧义的困难 token(如需要多步推理的长难句关键词),都被强制激活 k 个专家。简单 token 计算冗余,困难 token 参数不足——这是一个结构性的资源错配。
Saliencro 等人于 2026 年 7 月 28 日提交的论文《Spend Experts Where You Are Unsure》正是针对这一问题提出了解决方案。研究团队的核心洞察优雅而直接:路由器的 softmax 输出分布本身就是逐 token 的不确定性信号——分布峰值尖锐说明路由器对专家选择很自信,分布平坦则说明多个专家都有可能、token 本身充满歧义。这一信号在现有框架中完全被丢弃了。
核心方法:CARE 的三层设计
CARE(Confidence-Adaptive Routing of Experts,置信度自适应路由)将专家激活从固定 top-k 改为逐 token 动态决策,包含三个核心机制:
Nucleus 专家准入。 受 nucleus sampling(核采样)启发,CARE 将路由器权重按降序排列,从最高权重专家开始累积,直到累积概率质量达到一个全局阈值 τ 时停止。这意味着高置信度 token 可能只激活 1-2 个专家,而高歧义 token 会自动激活更多专家。论文从理论上证明,截断带来的适配器输出近似误差上界为 (1-τ)·max‖e_i‖,τ 本质上是一个保真度控制参数。
认知分歧扩展。 仅靠路由器分布可能遗漏一种特殊情况:已选专家之间意见不一致。CARE 引入了一个无尺度分歧度量 D,计算已准入专家集合内输出的归一化方差。当分歧超过阈值 δ 时,动态扩展专家集合最多 γ 个。这相当于一个轻量级的集成机制:当专家们"吵起来了",就多听几个意见;当意见一致时,零额外开销。
预算恒温器。 实际部署中需要控制计算开销。CARE 设计了一个 budget thermostat:由于平均激活专家数 k̄(τ) 对 τ 单调非减,只需在小型校准集上通过一次二分搜索找到目标预算 B 对应的 τ*,即可保证推理时平均激活专家数精确对齐任意目标预算。
整套机制零额外参数、单次前向传播,与需要多次采样的贝叶斯方法或集成方法形成鲜明对比。Algorithm 1 仅增加了 O(N log N) 排序和 O(|S|d) 分歧计算,且这些操作仅涉及路由器已经评估过的专家。
实验数据:用更少专家达到同等精度
论文在 LLaMA-3.1-8B 和 Qwen2.5-7B 两个主流基座模型上进行了全面实验,覆盖 8 个常识推理基准以及数学、代码、知识任务。
等计算量比较。 在匹配相同平均激活专家数的条件下,CARE 在所有基准上一致优于固定 top-k MoE-LoRA。这意味着相同的计算预算下,CARE 通过将计算从简单 token 转移到困难 token,实现了更好的整体效果。
等精度比较。 以固定 k=4 的 MoE-LoRA 为基线,CARE 在激活更少专家的情况下达到同等精度。根据第三方评测估算,推理延迟可降低 20-30%,这对成本敏感的生产级部署意义重大。
分布外检测。 一项令人惊喜的副产品是,CARE 的置信度与分歧信号在 OOD 检测上全面优于 Maximum Softmax Probability(MSP)、熵法以及多通集成代理方法。同一套路由信号既节省了推理计算,又免费获得了一个分布外检测器——部署模型无需额外代价即可标记不可靠输入。
商业启示:推理效率优化的新杠杆
CARE 为思陌大模型微调的推理部署服务和模型评估优化业务带来了直接启发:
推理部署。 思陌为客户提供量化压缩 + 推理引擎 + 部署的全栈服务。MoE-LoRA 适配器在推理时叠加的额外计算开销一直是一个隐性成本。CARE 提供的预算恒温器让客户可以精确控制推理延迟与精度的 trade-off:设定目标预算 B,模型自动将计算分配给最需要它的 token。结合思陌已有的量化推理管线,这可以成为差异化竞争力——“同样的精度,更低的推理成本”。
指令对齐。 CARE 的"认知分歧扩展"机制本质上是一种轻量级集成,可以被借鉴到 RLHF/DPO 对齐流程中。当奖励模型对某个偏好对的评估存在分歧时,自动引入更多评估信号而非强制拟合——这与思陌在指令微调与对齐中追求鲁棒性的目标高度一致。
领域适配。 在行业语料继续预训练(CPT)后,领域内的 token 分布会发生变化。CARE 的置信度信号可以作为微调效果的实时监控指标:领域内 token 的路由熵应该更低(更确定),如果出现大面积高熵 token,提示可能需要进一步的数据工程优化。
📄 论文原文信息
| 论文标题 | Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA |
| 作者 | Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel Whitmore |
| 期刊 | arXiv 预印本(2607.26052) |
| 发表时间 | 2026-07-28 |
| DOI | 10.48550/arXiv.2607.26052 |