DPO 偏好优化如何精准归因每个 token?GAW-PO 梯度对齐加权方法解析
GAW-PO 提出梯度对齐的 token 重加权方法,让 DPO 在 token 粒度上精准分配偏好信号,跨 11 个基准平均提升 0.97 分。
研究背景
直接偏好优化(Direct Preference Optimization,DPO)已经是大模型微调中对齐模型行为的主流方法之一——它不需要单独训练奖励模型,直接用「偏好对」(一个被选中的回复 + 一个被拒绝的回复)就能让模型学会什么该说、什么不该说。
但一个长期被忽略的细节是:DPO 是在「整段回复」层面施加偏好信号的,而自回归语言模型实际是「一个 token 一个 token」地生成的。这种粒度错配带来一个明显问题——在被拒绝的回复里,并非每个 token 都是「坏」的,其中不少 token 其实编码了与偏好回复一致的有用行为,却也被一视同仁地惩罚了。
来自布加勒斯特理工大学的 Andreea Dutulescu 等人注意到这一点,并在 2026 年 10 月 1 日发布的论文中提出了针对性的改进方案 GAW-PO(Gradient-Aligned Weighting for Preference Optimization,梯度对齐加权的偏好优化)。
核心方法
GAW-PO 的思路很直观:对每个被拒绝回复里的 token,先判断「惩罚它」会不会干扰到偏好方向的学习,再据此决定惩罚的强度。
具体做法是计算该 token 的梯度与偏好更新方向之间的对齐程度(余弦相似度)。如果某个 token 的梯度方向与偏好行为高度一致,说明它其实是「好」的,就给它一个较弱的负向信号;如果方向冲突,则保留较强的惩罚。
这样一来,偏好优化就从粗粒度的「整段对错」细化成了 token 级信用分配(credit assignment)。更重要的是,GAW-PO 不改变 DPO 的整体训练框架,只需在损失函数里加入一个可微的加权项,几乎不增加额外计算开销。
两者差异可概括如下:
| 维度 | 标准 DPO | GAW-PO |
|---|---|---|
| 监督粒度 | 整段回复 | 单个 token |
| 对「共享有用 token」的处理 | 一并惩罚 | 识别并减弱惩罚 |
| 对「冲突 token」的处理 | 同等惩罚 | 保留较强惩罚 |
| 额外开销 | 无 | 几乎可忽略 |
实验数据
实验覆盖了 11 个基准,横跨数学、推理、编程和问答四类任务。结果显示,GAW-PO 在这些基准上的平均成绩是所有被评测偏好优化方法中最高的:
- 比标准 DPO 平均提升 0.97 分;
- 比最强的竞争基线再高 0.65 分;
- 在更激进的偏好优化下依然保持稳定(详见下文)。
作者还验证了一个关键的鲁棒性优势:当 DPO 的正则化系数 β 逐步降低(即进行更激进的偏好优化)时,标准 DPO 的性能会急剧下降,而 GAW-PO 不降反升。这说明梯度对齐加权能够有效区分「该惩罚的冲突 token」和「不该误伤的共享 token」,从根本上缓解了激进优化带来的过拟合与退化。
行业启示
从大模型微调的工程视角看,GAW-PO 揭示了一个通用原则:偏好信号的价值不在于「罚得多」,而在于「罚得准」。
这对领域大模型训练尤其有启发——无论是通用基座还是垂直场景的指令对齐,训练数据的偏好对里往往混杂着大量共享的有用知识,粗粒度的整段惩罚会把这些知识一并抹掉。把偏好优化下沉到 token 层级的信用分配,用更低的训练代价换来更稳的对齐效果,是值得工程团队在 SFT 之后的 RLHF/DPO 阶段重点验证的方向。
相关问题
问:GAW-PO 和标准 DPO 有什么区别?
答:标准 DPO 在整段回复层面施加偏好信号,被拒绝回复里的所有 token 都受到同等的负向惩罚;GAW-PO 则对每个 token 计算梯度与偏好方向的对齐程度,方向一致的 token 给予较弱惩罚、方向冲突的 token 保留较强惩罚,实现 token 级信用分配。
问:GAW-PO 的实验效果如何?
答:在覆盖数学、推理、编程、问答的 11 个基准上,GAW-PO 平均成绩最高,比标准 DPO 提升 0.97 分,比最强竞争基线提升 0.65 分;且对激进的偏好优化(降低 β)更加鲁棒。
问:GAW-PO 会增加训练开销吗?
答:不会明显增加。GAW-PO 不改变 DPO 的整体训练框架,只需在损失函数中加入一个可微的加权项,几乎不引入额外计算开销。
参考文献
📄 论文原文信息
| 论文标题 | GAW-PO: Preference Optimization with Gradient-Aligned Token Weights |
| 作者 | Andreea Dutulescu, Stefan Ruseti, Mihai Masala, Traian Rebedea, Mihai Dascalu |
| 期刊 | arXiv preprint (cs.CL) |
| 发表时间 | 2026-10-01 |
| DOI | 10.48550/arXiv.2610.01511 |
论文原文信息地址:https://www.simolm.com/blog/2026-10-05-gaw-po-gradient-aligned-token-weights/