← 行业趋势
大模型怎样从用户反馈中持续自我改进?SLIFT 双适配器选择性自学习框架解析

大模型怎样从用户反馈中持续自我改进?SLIFT 双适配器选择性自学习框架解析

清华大学与腾讯提出 SLIFT 选择性自学习框架,将用户反馈分解为 Fix/Spec/Null 三类并训练 Generalist 与 Specialist 双 LoRA 适配器。Qwen3-8B 在 MemoryBench 平均 Norm-Score 达 55.85,较基线提升 6.68 分,且 MMLU-Pro 知识推理零退化。

封面

用户反馈是金矿,但也是雷区

做过企业级大模型落地的人都知道,模型上线只是开始。真正的持续改进来自用户每天与它交互时产生的反馈——“这里答错了"“这个格式不对"“这个回答应该用术语而不是大白话”。这些信号天然就是监督信号,但把它们直接灌进模型却是个技术雷区。

2026 年 8 月 10 日,清华大学计算机系与腾讯联合团队在 arXiv 提交了论文 Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models(arXiv:2608.09109)。核心洞察很朴素但此前没人系统解决:一条用户反馈消息往往同时要求多种不同的行为改变,而这些改变该"泛化"的范围根本不一样。比如用户说"以后回答都要用中文术语、并且这条具体问题的单位要换算成毫米”——前半句是全局规则(对所有任务生效),后半句只是这条任务的条件细化(仅在此情境下生效)。如果一刀切地全量更新,要么全局规则没固化,要么一次性条件被错误泛化、污染了默认行为。

核心方法:把反馈拆成原子,再分两条管线训练

SLIFT 的做法是把"用户反馈"这件事从整条消息的粗粒度,下沉到原子组件的细粒度,并用一个任务相对(task-relative)的视角给每个组件定性。

第一步,原子分解与三元判定。 系统把每条反馈拆解成最小可操作的原子组件,再相对原始任务把每个组件判为 Fix、Spec 或 Null 三类:

  • Fix(任务合法性要求):构成任务"做对"的刚性前提,应当沉淀为模型的默认行为,对所有同类输入生效;
  • Spec(条件性细化):与当前任务兼容、但只在特定条件下适用的补充要求,不该污染默认行为;
  • Null(无可靠正向更新方向):模糊、矛盾或无法可靠归因到正向改进的内容,直接不产生任何更新。

论文给出的统计很说明问题:在 Qwen3-8B 的 MemoryBench 反馈上,Fix/Spec/Null 的占比是 23.6% / 50.8% / 25.6%;而更真实的 WildFB 用户反馈里 Null 高达 37.7%(Fix 19.4% / Spec 42.9%)。也就是说,接近四成的真实反馈其实不该触发任何参数更新——这正是朴素自学习容易"被一条随手反馈带偏"的根源。

第二步,双 LoRA 适配器分而治之。 SLIFT 在共享的冻结基座上训练两个互补的 LoRA 适配器,把不同范围的改变落到不同参数空间:

  • Generalist(通才):通过"反馈条件自蒸馏”(feedback-conditioned self-distillation)把 Fix 类要求固化成默认行为。它看到的是带反馈标注的训练数据,学习的是"这类任务默认就该这么答"。
  • Specialist(专才):只观察原始任务 + Generalist 的回答,针对那些"适用但 Generalist 尚未满足的 Spec 细化"提供残差引导。它不碰全局默认,只在满足条件时叠加修正。

这一点设计直击持续学习的老问题:把全局规则和一次性条件塞进同一组参数,必然互相干扰、引发灾难性遗忘。SLIFT 用"通才守默认、专才补特例"的分工,让两类信号各得其所。

技术原理

整个框架不依赖全参数微调,两个适配器都建立在 LoRA 之上,工程上可以直接叠加到现有 PEFT 流程里,代码已开源。

实验数据:记忆与真实反馈双场景领先,知识能力零退化

论文在 Qwen3-8B 与 Ministral3-14B-Instruct 两个基座上,用 MemoryBench(模拟反馈)和 WildFB(1.5 万条真实用户反馈)两套基准做了验证,对比了检索式、外部记忆式与参数训练式多条基线。

MemoryBench(样本加权 Norm-Score,越高越好):

  • Qwen3-8B:SLIFT 达 55.85,显著超过最强参数基线 SDPO(49.56)与 SFT(48.63)、DPO(47.81),相比未适配的 Base(49.17)绝对提升 +6.68 分;仅用 Generalist 的 SLIFT-Gen 也有 51.88,说明 Specialist 额外贡献约 1.8–2.4 分。
  • 分长度区间看,SLIFT 在 Short-Short / Short-Long / Long-Short / Long-Long 四个分区分别拿到 70.49 / 58.00 / 45.22 / 49.68,全部高于所有基线,长文本场景的优势尤其明显。
  • Ministral3-14B:SLIFT 53.22,相比 Base 49.81(+3.41)、相比 SDPO 48.69(+4.53)。

WildFB(真实反馈,由 WildReward-8B 与标准指令遵循基准评测):

  • 在 Qwen3-8B 与 Ministral3-14B 上,SLIFT 的 IFEval 严格指令遵循准确率与 AlpacaEval 2.0 长度控制胜率均优于 Base 及 SFT/DPO/SDPO 等参数基线;WildReward 胜率有微弱正向增益;MMLU-Pro 知识推理精度基本持平,无显著退化

实验结果

消融实验(Ministral3-14B)进一步坐实了每个组件的必要性:

变体 MemoryBench IFEval AlpacaEval 2.0
SLIFT(完整) 53.22 69.71 66.35
w/o 原子分解 51.30 67.89 65.22
w/o 任务上下文 50.74 67.34 63.98
w/o 双通路分工 51.05 67.62 64.61
w/o Specialist(仅 Generalist) 51.42 67.28 64.27
w/o KEEP 监督 50.86 57.63 64.06

去掉原子分解或去掉角色分配时的任务上下文,掉点最猛;而 Specialist 把 IFEval 从 67.28 拉到 69.71、AlpacaEval 从 64.27 拉到 66.35。更关键的是知识守恒:Generalist 在 MMLU-Pro 上的变化仅 ΔG = -0.11,Specialist 更是 ΔS = 0.00——双适配器分工让模型在吸收用户反馈的同时,没有牺牲已有的通用知识推理能力

需要说明边界:WildFB 中"完全可用的反馈率"只有 50.4%(标准化后 96.7%),意味着真实反馈里近一半信号质量不足,这也是真实反馈增益相对 MemoryBench 偏小的原因;论文未包含"全参数微调"与"标准独立 LoRA"的直接对比,因此 SLIFT 的优势是针对自学习/自蒸馏这一类持续学习基线而言的。

商业启示:把"用户反馈闭环"做成可交付的工程能力

对思陌大模型微调的客户项目,这篇论文指向一个常被忽略但越来越重要的交付环节——上线后的自我进化能力

指令对齐(指令微调/SFT/DPO)需要引入"反馈分级"机制。 我们给客户做对齐时,训练数据大多来自一次性标注,缺少"用户上线后持续纠错"这条活水。SLIFT 的 Fix/Spec/Null 三元判定可以直接变成我们的数据工程流水线:把客户运营团队每天的人工纠错自动分级,Fix 类沉淀进通用 SFT 集、Spec 类走条件化适配、Null 类直接过滤。这能显著降低"一句话反馈把模型带偏"的线上事故概率。

数据工程环节可借双适配器实现"热更新不回退"。 企业客户最怕的是:为修一个 bug 重新全量微调,结果把上周刚对齐好的能力冲掉。SLIFT 的 Generalist 守默认、Specialist 补特例的分工,本质上就是一套"增量热补丁"范式——可以用 LoRA 叠加实现零回退的能力追加,这与我们给客户做持续交付(而非每次推倒重来)的诉求高度契合。

评估优化环节要把"知识守恒"设为回归门禁。 论文里 MMLU-Pro 零退化的结果提示我们:任何一次基于反馈的再训练,都必须跑一遍通用能力回归测试,防止局部优化悄悄侵蚀全局能力。这应成为我们交付流程里的一道固定质检项。

推理部署层面,SLIFT 不增加推理架构复杂度(仍是 LoRA 叠加,无常驻双模型),意味着我们现有的推理服务栈无需为"支持持续自学习"做额外改造——这是一个对交付友好、成本可控的方案。


参考文献

  1. Li, X., Li, H., Zhou, Y., Pan, Q., Wang, H., Liu, Y., Zhang, M., & Ai, Q. (2026). Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models. arXiv: 2608.09109 | DOI: 10.48550/arXiv.2608.09109
  2. 论文开源代码仓库:SLIFT (4open.science)

本文为思陌大模型微调团队对公开论文的独立解读,数据与结论均以原文为准,不代表原作者观点。

📄 论文原文信息

论文标题Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models
作者Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai(清华大学计算机系 & 腾讯)
期刊arXiv preprint (cs.AI)
发表时间2026-08-10
DOI10.48550/arXiv.2608.09109

论文原文信息地址:https://www.simolm.com/blog/2026-08-12-slift-selective-self-learning-user-feedback/