大模型后训练没有标注答案怎么办?U-OPSD 零标注自蒸馏追平并超过有监督 GRPO
加州大学圣迭戈分校提出 U-OPSD,用模型自己的多数投票结果替代人工标注答案做在策略自蒸馏。Qwen3-8B 在五个竞赛数学基准上平均分从 43.57 提升到 54.31(+10.74),超过用了真实标注的 GRPO(45.43)和 OPSD(52.04),而全程一条标注数据都没用。
一、后训练最贵的那一项,其实是"答案"
在企业做大模型后训练,最先卡住项目的往往不是算力,而是标注。
无论走哪条技术路线,现有主流方法都要求外部提供一个"对错裁判":SFT 需要人写出标准答案,GRPO/RLVR 需要一个能验证结果的奖励函数,蒸馏则需要一个比自己更强的教师模型。放到真实业务里,这三样常常同时缺席——法务合同的审查结论没有唯一解、工业排产的最优方案无法自动验证、客服话术的好坏更没有现成的更强教师。于是团队被迫先花几十万做标注,再谈微调。
来自加州大学圣迭戈分校的 Yijiang Li、Bingyang Wang 与 Nuno Vasconcelos 等人在 2026 年 8 月 6 日提交的论文 On-Policy Self-Distillation without Any Supervision 中提出了一个反直觉的结论:在模型"已经有点会、但还不稳"的能力区间里,标注答案是可以被模型自己的共识替代的。
他们提出的方法叫 U-OPSD(Unsupervised On-Policy Self-Distillation,无监督在策略自蒸馏)。最抓眼球的一组数字是:Qwen3-8B 在五个竞赛数学基准上的平均分,从基线的 43.57 提升到 54.31,涨了 10.74 分;而同期用了真实标注答案的 GRPO 只做到 45.43,有监督版本的 OPSD 做到 52.04。不用标注的那一版,反而赢了用标注的。
二、把"多数投票"从答案升级成教师
要理解 U-OPSD 为什么能成,得先看清它和其他无监督方法的区别在哪。
过去的无监督后训练大多走"自我奖励"路线:TTRL 用多数投票当伪奖励做强化学习,RENT 最小化熵,Intuitor 用模型自我确信度当奖励。这些方法本质上都是把一个标量信号(对/错、置信高/低)反馈给模型。论文的实验显示,这类方法收益极为有限——在 Qwen3-8B 上,TTRL 只带来 -0.03 分,RENT 是 -0.60 分,Intuitor 是 -0.05 分,基本等于没动。
U-OPSD 换了个思路:不把共识当奖励,而把共识当上下文,然后从中蒸馏出一个稠密的 token 级分布。整个流程分三步:
第一步,采样并投票。 对每道题采样 G=8 条推理轨迹,按最终答案做多数投票。只有当票数占比越过自一致性阈值 τ=1/2 时才继续,否则这道题不产生任何梯度。
第二步,构造"开卷教师"。 在与多数派答案一致的轨迹中挑出最短的那条作为伪解 y⁺。教师是学生自己的一份 stop-gradient 副本,但它的输入里多了 y⁺——相当于让模型"看着自己的答案再做一遍"。这是一个开卷版的自己。
第三步,在错误轨迹的每个前缀上对齐。 取那些与多数派不一致的轨迹作为学生轨迹,在它的每一个前缀位置上,把开卷教师的下一 token 分布蒸馏给闭卷学生。
第三步是整个方法的精髓。它回答的不是"这道题答案是什么",而是"在我跑偏的那个具体位置上,如果我知道答案,我会怎么走"。监督信号因此从一道题一个标量,变成了一条轨迹上成百上千个 token 级分布。
还有一个值得注意的设计副作用:全票通过的题(太简单)和票数不过半的题(太难)都不贡献梯度,训练自动聚焦在模型的能力边界上。这一点和课程学习的效果不谋而合。
三、实验数据:无监督反超有监督
论文在 AIME24、AIME25、HMMT25、MATH500、AMC23 五个基准上做了完整对比。非思考模式(non-thinking)下的结果如下:
| 方法(Qwen3-8B) | 是否用标注 | AIME24 | AIME25 | MATH500 | 五项平均 |
|---|---|---|---|---|---|
| Base | — | 27.50 | 23.33 | 84.05 | 43.57 |
| + SFT | 是 | 26.94 | 21.67 | 84.10 | 43.43 |
| + GRPO | 是 | 30.56 | 21.94 | 87.85 | 45.43 |
| + OPSD | 是 | 41.67 | 28.06 | 87.15 | 52.04 |
| + TTRL | 否 | 27.22 | 21.11 | 84.45 | 43.54 |
| + RENT | 否 | 28.33 | 21.67 | 84.00 | 42.97 |
| + Intuitor | 否 | 26.11 | 22.50 | 84.20 | 43.52 |
| + u-OPSD | 否 | 45.56 | 34.72 | 89.55 | 54.31 |
Qwen3-4B 上的趋势完全一致:基线 40.96,GRPO 45.86,OPSD 46.29,而 u-OPSD 达到 49.49,比基线高 8.53 分,比有监督的 OPSD 还高 3.20 分。AIME24 单项从 25.83 拉到 37.50。
思考模式(thinking)下由于基线已经很高,提升空间被压缩,但排序没变:Qwen3-4B 从 74.85 提升到 77.05,压过 GRPO 的 76.35;Qwen3-8B 从 76.09 提升到 77.99,与有监督 OPSD 的 77.97 基本持平,超过 GRPO 的 76.92。
方法在更大和更强的模型上同样成立。Qwen3-30B-A3B-Instruct-2507 从 75.77 提升到 77.46,Qwen3-4B-Instruct-2507 从 67.00 提升到 68.78,两者的有监督 OPSD 对照组分别只有 76.33 和 67.10。
两组消融实验解释了"为什么是蒸馏而不是打标签":
其一,稠密分布远胜硬标签。 如果只用教师采样出的 token 作为硬标签训练(退化成一种 SFT),平均分只有 43.45;改成对齐教师的 top-100 概率分布,平均分冲到 59.01,差距 15.56 分。信息量的差异是决定性的。
其二,散度选择不能随意。 前向 KL 得到 57.10 分,JSD 只有 43.34 分(几乎无增益),而反向 KL 直接训练发散、无法评分。这与 OPSDC 等推理压缩工作偏好反向 KL 的结论正好相反,说明"教师带答案、学生不带答案"这种非对称设定下,必须用前向 KL 做覆盖式对齐。
四、必须说清的适用边界
这套方法有一个明确的承重假设:多数投票的答案得基本靠谱。如果模型在某个领域上的共识系统性偏错,U-OPSD 会把错误答案当教师稳稳地蒸馏进去,越练越偏。论文自己的门控设计(τ=1/2、全对全错都跳过)部分缓解了这一点,但没有根除。
第三方评议也指出了一处需要留意的地方:Pith Review 在 2026-08-07 的审读中认为,“超过有监督 OPSD"这一头条结论存在 token 预算不完全对齐的问题——U-OPSD 因为要采样 8 条轨迹,实际消耗的生成算力高于对照组,比较的公平性有待更严格的等算力实验确认。因此更稳妥的表述是:在同等训练步数下,U-OPSD 用零标注达到了有监督方法的水准,而不是断言它在任何预算下都更强。
对企业而言,还有一条工程上的隐性成本:每道题 8 次采样意味着数据构造阶段的推理开销是常规 SFT 的数倍。这笔账要和省下的标注费一起算。
五、对大模型微调业务的启示
这篇论文对思陌大模型微调的几条业务线都有直接的参照价值。
在数据工程方向,它把"无标注语料"的价值重新定价了。过去客户手里堆积的历史工单、审查记录、研发问答,因为缺少标准答案而无法进入训练流程;U-OPSD 提供了一条把纯问题集(unlabeled prompts)直接转化为训练信号的路径。对于标注成本高、专家时间稀缺的领域,这可能意味着项目启动周期从"先标三个月"压缩到"先跑一轮采样”。
在领域适配训练方向,“训练自动聚焦能力边界"这个特性尤其实用。企业模型在领域内往往呈现明显的能力断层——一部分任务已经稳定过关,一部分完全做不了,真正值得投入的是中间那段。U-OPSD 的自一致性门控天然筛出了这一段,避免算力浪费在已会和不会的两端。
在指令微调与对齐以及模型评估优化方向,论文给出的两条工程结论可以直接复用:一是蒸馏要用 top-k 分布而非硬标签,二是这类非对称师生设定下要用前向 KL。同时它也提醒我们,落地这套方法前必须先做一件事——在客户的留出集上实测多数投票的准确率。这个数字如果不够高,方法就不该上线。这恰恰是评估体系要前置的典型场景。
最后值得留意的是,U-OPSD 与 LoRA、量化、模型合并这些方向是正交的:它改变的是训练信号从哪来,而不是参数怎么更新。这意味着它可以叠加在现有的参数高效微调流水线上,而不需要推倒重来。
参考文献
-
Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos. On-Policy Self-Distillation without Any Supervision. arXiv preprint, 2026-08-06. arXiv: 2608.06296 | DOI: 10.48550/arXiv.2608.06296
-
Hejian Sang, Yuanda Xu, Zhengze Zhou, et al. On-Policy Self-Distillation for Reasoning Compression (OPSDC). arXiv preprint, 2026-03-05.(反向 KL 在推理压缩场景的对照工作) arXiv: 2603.05433 | DOI: 10.48550/arXiv.2603.05433
-
Yuxin Zuo, Kaiyan Zhang, Shang Qu, et al. TTRL: Test-Time Reinforcement Learning. arXiv preprint, 2025.(多数投票伪奖励的强化学习基线) arXiv: 2504.16084 | DOI: 10.48550/arXiv.2504.16084
📄 论文原文信息
| 论文标题 | On-Policy Self-Distillation without Any Supervision |
| 作者 | Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos,University of California San Diego 等 |
| 期刊 | arXiv preprint (cs.LG) |
| 发表时间 | 2026-08-06 |
| DOI | 10.48550/arXiv.2608.06296 |
论文原文信息地址:https://www.simolm.com/blog/2026-08-10-uopsd-unsupervised-self-distillation/