大模型推理微调如何突破二元奖励瓶颈?GAR 梯度对齐奖励方法解析
GAR 在策略自身梯度空间用截断反向传播提取紧凑梯度、与专家锚点做余弦相似度,构造密集奖励,wall-clock 开销仅 +8.3%;在 Qwen3-4B/8B 上全面超越 GRPO,并零域外数据迁移到 GPQA Diamond(+2.57pp)与 MMLU-Pro(+2.41pp)。
强化学习 + 可验证奖励(RLVR),以 DeepSeek-R1 与 o1 系列为代表,已经成为后训练推理模型(reasoning model)的事实标准。它的主流实现 GRPO(Group Relative Policy Optimization)用一个二元结果奖励——答案对就是 1、错就是 0——来驱动模型学会一步步思考。但这里藏着一个被长期忽视的痛点:二元奖励无法区分"同样做对"的轨迹孰优孰劣,那些碰巧蒙对的和真正推理严密的正确解,拿到的是同等的学习信号。为了补上这个"奖励太稀疏、太粗糙"的缺口,业界要么靠格式、长度这类表面启发式,要么靠过程奖励模型(PRM),前者抓不住推理质量,后者需要昂贵的离线标注。近日,Leqi Zheng、Jinbo Su、Fang Niu 等研究者在一篇论文中给出了一个更优雅的答案——GAR(Gradient-Aligned Reward,梯度对齐奖励):它不额外训练任何奖励模型,而是直接钻进策略自己的梯度空间里"偷"出密集、推理感知的奖励信号。
核心方法:在梯度空间里给奖励"加密度"
GAR 的核心洞察是:一条推理轨迹的"质量",其实已经编码在模型对它的梯度里了。具体做法很轻量——对每条 rollout,只做一次在输出投影层(lm_head)截断的反向传播,就提取出一个紧凑的梯度向量;再拿它与一条"专家锚点梯度"(expert-anchor gradient)算余弦相似度,这个相似度就是密集奖励。专家锚点从哪来?正是训练语料里本就存在的标准解法(expert solution),无需额外标注。
这一设计的成本优势极其明显:因为梯度在输出投影层就截断了、错误的响应会被验证器 gate 直接剔除、专家锚点向量在同一个 rollout 组内还能缓存复用,GAR 相比纯结果奖励的 GRPO,额外 wall-clock 开销只有 +8.3%。对比之下,同样走"梯度给奖励加密度"路线的 G2RL 要多花 +37.1%,Grad2Reward 更是 +43.7%——GAR 的成本不到它们的 1/4 与 1/5。
理论支撑:这个余弦值到底在度量什么
GAR 不只是"有效",作者还给了一个漂亮的乘法分解定理(Theorem 2):输出层的这个梯度内积,可以近似拆成两个因子的乘积——
- 预测误差因子(prediction-error factor):两条轨迹各自的"每-token 预测分布与真实目标差值"的内积,本质是在问——它们在哪些输出 token 上需要纠错、纠错方向是否一致;
- 激活模式因子(activation-pattern factor):两条轨迹在进入 LM head 前隐藏表征的内积,本质是在问——它们是否动用了相似的计算通路。
乘法结构意味着:只有两个因子同时高,奖励才会高。也就是说,即使最终答案正确,如果是靠一条截然不同的推理路径蒙出来的,激活模式对不上,乘积依然会掉下来。作者用 6 道训练题做了实证:同一解法路径下正确 rollout 的余弦均值高达 0.45,而不同正确解法的均值只有 0.13,前者约为后者的 3.5 倍——这证明 GAR 区分的是底层的推导策略,而不是长度、格式这类表面特征。
实验结果:全基准正提升,零域外数据迁移
论文在 Qwen3-4B 与 Qwen3-8B 两个基座上做了系统验证,结论可以用"无死角"来形容:
- 竞赛级数学基准全面超越 GRPO:在 IMO-AnswerBench、HMMT 2025/2026、AIME 2026 四个基准上,所有模型规模、所有 pass@k(P@1/P@4/P@16)均为正提升,无一例外。以 8B 为例,AIME 2026 的 P@1 提升 +1.17pp,HMMT 2025 的 P@1 提升 +1.50pp(相对 +33.3%);低 k(尤其 pass@1)提升更显著,说明 GAR 把概率质量集中到了"高质量正确解"上,而非仅仅扩大覆盖面。
- 零域外数据迁移到通用推理:仅用数学数据训练、在 GPQA Diamond 与 MMLU-Pro 上做 zero-shot 评估,GAR-GRPO 依然每列都超过最强基线——4B 规模上 GPQA Diamond P@1 提升 +2.57pp、MMLU-Pro 微平均 P@1 提升 +2.41pp;8B 规模四项指标提升稳定在 2.02~2.29pp 之间。
这意味着 GAR 带来的不是"换道超车"的偶然波动,而是一种可以稳定叠加在现有 RLVR 流程之上的通用增益,且几乎不增加额外训练成本。
商业启示:把"密集奖励"纳入指令对齐的标准交付
对思陌大模型微调而言,GAR 精准命中了「指令微调与对齐」(SFT + RLHF/DPO)和「模型评估优化」两条业务线的共同痛点:客户在做推理型模型定制时,最怕的就是"训练跑得动、但对齐效果上不去"。GAR 的价值在于用极低的边际成本换到更密集、更讲推理质量的训练信号——它不需要训练奖励模型,也不需要额外标注过程监督数据,只需在现有 RLVR 流程里插入一段 lm_head 截断反向传播即可。这意味着我们可以在不显著抬升 GPU 占用和排期的情况下,为客户交付"更懂推理、而不是更会蒙"的对齐效果;尤其对数学推理、代码生成这类"答案可验证、但过程质量至关重要"的垂直领域,GAR 是一条值得率先落地验证的技术路线。同时,“预测误差 × 激活模式"的分解,也为我们做模型评估提供了一个更细粒度的诊断视角——既能看清模型在纠错方向上的偏差,也能看清它是否真的动用了正确的计算通路。
参考文献
- arXiv: 2609.03342 — Gradients Know What Outcomes Don’t: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards
- DOI: 10.48550/arXiv.2609.03342
📄 论文原文信息
| 论文标题 | Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards |
| 作者 | Leqi Zheng, Jinbo Su, Fang Niu 等 |
| 期刊 | arXiv 预印本 (cs.LG) |
| 发表时间 | 2026-09-03 |
| DOI | 10.48550/arXiv.2609.03342 |
论文原文信息地址:https://www.simolm.com/blog/2026-09-14-gar-gradient-aligned-reward/