← 行业趋势
多任务大模型微调为什么越练越差?SFT冲突与RL共存机理揭示,Parallel-RL并行训练保留103.2%单任务性能

多任务大模型微调为什么越练越差?SFT冲突与RL共存机理揭示,Parallel-RL并行训练保留103.2%单任务性能

中科院自动化所与清华团队发现多阶段SFT在数学、科学、逻辑、代码四类任务上平均掉点23.1%,而多阶段RL反涨24.9%。根源在于RL跨任务参数更新的余弦相似度低至10⁻⁵近似正交,据此提出的Parallel-RL并行训练+合并范式仅需5%额外数据即达单任务RL的103.2%性能。

封面

研究背景:一个所有微调服务商都撞过的墙

给客户交付大模型定制时,最常见的需求形态不是"把某一件事做好",而是"把这五件事都做好"——既要会算行业里的数学题,又要懂专业知识问答,还要能写代码、能做逻辑推理。工程上最自然的做法是分阶段依次微调:先练数学,再练科学,然后逻辑,最后代码。

然后就翻车了。练完第四个任务回头一测,第一个任务的分数掉得比不练还低。业界通常把这归因于"灾难性遗忘",解法也很程式化——混合数据一起训、加回放缓冲、调学习率。但很少有人追问一句:为什么强化学习路线做同样的事,却几乎不掉点?

由中国科学院自动化研究所与清华大学研究者组成的联合团队(Kejian Zhu、Zhuoran Jin、Shangqing Tu、Hongbang Yuan、Yushi Bai、Kang Liu、Juanzi Li、Jun Zhao)在 2026 年 8 月 4 日提交、8 月 6 日更新的论文中,把这个现象从"经验观察"推到了"参数层面的机理解释",并顺势提出了一个颇具工程价值的训练范式 Parallel-RL。论文标题就是结论本身:SFT Conflicts, RL Coexists——监督微调会打架,强化学习能共存。

团队用 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 两个基座,在四个推理领域上做了系统对比:数学(MATH500、AIME2025)、科学(MMLU、GPQA)、逻辑(Knights & Knaves)、代码(LiveCodeBench)。初步实验的数字相当刺眼——以 1.5B 基座(数学 83.1 / 科学 34.9 / 逻辑 31.0 / 代码 15.0)为起点,多阶段 SFT 训完平均比基线还低 23.1%,逻辑任务从 31.0 崩到 9.0;而多阶段 RL 平均比基线高 24.9%,逻辑任务反而涨到 43.0。

核心发现一:单任务训练时,SFT 就已经在偷偷破坏别的能力

在解释多阶段崩塌之前,团队先做了一个更干净的实验:只训练一个任务,然后测所有任务。

结果非常清晰。SFT 让目标任务平均提升 4.0%,但未训练的任务平均下降 5.1%——最极端的一组是用数学数据做 SFT,逻辑任务直接掉了 16.0%。RL 则完全是另一副面孔:目标任务平均提升 6.8%,未训练任务还平均涨了 2.3%

这个对比排除了"多阶段调度顺序"这类工程变量。冲突不是训练流程设计不当造成的,而是优化范式本身带来的。SFT 在提升一个能力的同时,会顺手挪动那些本来服务于其他能力的参数;RL 却像在参数空间里各走各的路。

技术原理

核心发现二:RL 的跨任务更新方向近似正交,余弦相似度只有 10⁻⁵

团队把两种范式训练出的参数增量 ΔW 直接拿出来做两两比较,得到了整篇论文最关键的一组数字:

  • SFT 跨任务的 ΔW 余弦相似度:约 10⁻¹ 到 1.0 量级,部分任务对甚至呈负相关(方向相反,直接对冲)
  • RL 跨任务的 ΔW 余弦相似度:约 10⁻⁵ 量级,工程上可视为近似正交

换成几何直觉:SFT 训练四个任务,是四个人在同一条窄路上互相推搡;RL 训练四个任务,是四个人在四个互相垂直的维度上各自前进,彼此几乎感受不到对方的存在。t-SNE 可视化也印证了这点——RL 的 score function 在表示空间形成清晰可分的簇,SFT 则严重重叠。

理论解释才是这篇论文的分量所在。 团队通过分析多任务梯度干扰,给出了定理 4.5:

  • SFT 的干扰是范数受限(norm-limited)的,上界正比于两个任务梯度幅值的乘积 M_i·M_j。SFT 的梯度是逐 token 的对数似然梯度,幅值大且方向由数据分布主导,两个任务的梯度只要都"大",干扰就必然显著。
  • RL 的干扰是方差受限(variance-limited)的,上界由优势归一化(advantage normalization)on-policy 优化共同压制的梯度方差 V_i·V_j 决定。GRPO 这类算法把组内优势标准化后,梯度期望方向被大幅收窄,方差界很小;在高维参数空间中,小方差随机向量之间近似正交的概率随维度指数收敛

这就把"RL 不打架"从玄学拉回了数学:不是 RL 更温和,而是优势归一化天然把不同任务的更新推向了高维空间中的互相垂直方向。

核心发现三:既然正交,那就没必要串行训练——Parallel-RL

正交性有一个非常实用的推论:如果 ⟨ΔW_i, ΔW_j⟩ ≈ 0,那么先训 A 再训 B分别训 A、B 后把两个增量相加,在参数空间里应该是近乎等价的。既然如此,多阶段串行训练就是在浪费时间——完全可以并行开 N 个独立 RL 进程,各训各的任务,最后合并:

W_final = W_base + 𝒜(ΔW_1, …, ΔW_N)

团队测试了三类合并函数 𝒜:

  1. Naive:直接求和(sum)或取平均(mean)
  2. Sparse:TIES 剪枝合并、SVD 只保留 rank-1 主方向
  3. Adapted:先 Naive sum,再用仅相当于原训练集 5% 的样本做一轮快速后适配

实验结果

1.5B 全参数主实验(数学 / 科学 / 逻辑 / 代码,单位 %,Retention 为相对单任务 RL 的性能保留率):

方法 Math Science Logic Code Retention
Single-Task SFT 85.8 49.1 37.0 16.3
Single-Task RL 87.4 51.8 44.0 21.6 100%
Multi-Stage SFT 71.0 33.2 11.0 12.1 崩塌
Multi-Stage RL 87.8 52.8 48.0 21.0
Parallel-RL (Naive sum) 86.4 48.0 39.0 18.4 94.2%
Parallel-RL (SVD) 87.2 48.3 42.0 15.9 94.6%
Parallel-RL (TIES) 87.6 49.2 43.0 19.7 97.4%
Parallel-RL (Adapted) 88.6 50.9 49.0 22.5 103.2%

几个值得注意的读数:最朴素的直接相加就已经保住了 94.2% 的单任务收益——这本身就是正交性假设最直接的实证。而 Adapted 版本用 5% 的额外数据,把性能推到了单任务 RL 的 103.2%,即合并后的多任务模型在数学、逻辑、代码三项上反超了各自的专用单任务模型。7B 基座上趋势一致,Adapted Parallel-RL 达到 96.2 / 66.8 / 70.0 / 41.5,保留率 102.4%。

解耦性消融(表 5)同样漂亮:从合并模型中移除某个任务的 ΔW_i,该任务性能平均跌 7.1%,而其他任务平均微涨 0.6%。这意味着每个任务的能力确实被独立封装在自己的增量里,可以像插拔模块一样增删——这对需要按客户订阅项动态组装能力的交付场景,价值不言而喻。

商业启示

这篇论文对思陌大模型微调的多条业务线都有直接的工程含义:

  • 指令微调与对齐:过去我们判断"多能力定制该用 SFT 还是 RL",主要看数据形态(有没有标准答案、有没有可验证奖励)。这篇论文补上了一个此前被忽略的判据——任务数量。单任务场景 SFT 依然高效;一旦客户需求超过两三个异构能力,SFT 多阶段方案的掉点风险是结构性的,不是调参能救的(实测平均 -23.1%)。此时应优先考虑可验证奖励 + GRPO 路线。

  • 基座模型微调:Parallel-RL 把"串行等待"变成了"并行开工"。原本四个任务需要依次排队占用同一批卡,现在可以四路同时跑,墙钟时间近似压缩到单任务量级。对交付周期紧张的项目而言,这不是几个百分点的优化,而是排期结构的改变。更重要的是增量交付能力:客户中途追加第五个能力,不需要重跑全流程,只需单独训练 ΔW_5 再合并。

  • 领域适配训练:解耦性消融揭示的"能力可插拔"特性,天然适配多租户和分版本交付。同一个基座,A 客户要数学+代码,B 客户要科学+逻辑,只需维护一份增量库按需组装,而不是维护四个完整的微调模型。这与我们此前关注的 LoRA 多租户服务思路可以叠加使用。

  • 模型评估优化:论文提供了一个可落地的诊断指标——训练前先测跨任务 ΔW 余弦相似度。如果某两个任务的相似度处在 10⁻¹ 量级,说明它们在参数空间高度耦合,混训冲突风险高,应当拆开或改用 RL;如果已在 10⁻⁵ 量级,则可放心并行。这个检测只需两次小规模试训,成本远低于跑完全流程才发现掉点。

  • 数据工程服务:Adapted 方案里的"5% 后适配数据"是个高杠杆环节——用极小的数据量换回 9 个百分点的保留率提升(94.2% → 103.2%)。这批数据怎么选、四个任务如何配比,直接决定合并质量,正是数据工程可以创造溢价的地方。

需要客观说明的边界:论文的验证集中在具备可验证奖励的推理类任务(数学、科学、逻辑、代码),这类任务天然适合 GRPO。对于开放式写作、风格模仿、多轮对话这类奖励难以自动判定的场景,正交性结论是否成立仍待验证。此外论文未给出具体的训练时长对比数据,“效率提升"主要来自并行化的结构性推论,实际加速比取决于集群资源调度。

但核心洞察是坚实的:多任务能力冲突不是模型容量不够,而是优化范式选错了。 换个范式,那些看似必须做取舍的能力,其实可以在高维空间里各行其道。


参考文献

📄 论文原文信息

论文标题SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
作者Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao — 中国科学院自动化研究所 / 清华大学
期刊arXiv preprint (arXiv:2608.03573), cs.CL / cs.LG
发表时间2026-08-04
DOI10.48550/arXiv.2608.03573

论文原文信息地址:https://www.simolm.com/blog/2026-08-08-sft-conflicts-rl-coexists-parallel-rl/