← 行业趋势
DPO 对齐训练如何避免 token 贡献一刀切?Se-DPO 自演化 Token Credit 方法解析

DPO 对齐训练如何避免 token 贡献一刀切?Se-DPO 自演化 Token Credit 方法解析

UCLA 吴英年团队与上海人工智能实验室提出 Se-DPO,用自演化 token credit 按每个 token 对偏好结果的贡献调制 KL 正则化,仅增加一个两层 MLP 校准网络(零外部模型),在 AlpacaEval 2 上较 DPO 提升 9.8 点、Arena-Hard 提升 7.1 点。

封面

DPO(Direct Preference Optimization,直接偏好优化)已经成为大模型对齐训练的主流方法之一——它绕开了 RLHF 需要显式奖励模型的复杂两阶段流程,直接用偏好数据对做监督式优化,门槛低、易落地。但 DPO 内部藏着一个长期被忽视的隐式假设:它在聚合 token 级的对数概率比时采用"均匀求和",也就是默认回复里的每一个 token 对偏好信号的贡献都完全相等。这显然违背直觉——一个决定回答对错的关键词,和一个可有可无的语气助词,对"这条回复是否更优"的影响不可能一样。2026 年 8 月 10 日,UCLA(加州大学洛杉矶分校)吴英年(Ying Nian Wu)教授团队与上海人工智能实验室联合在 arXiv 提交论文《Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization》(arXiv:2608.09568),把这层假设拆开,用"自演化 token credit"让每个 token 按贡献大小参与优化。论文已被 COLM 2026 接收。

技术原理

作者首先定义了 token credit(token 信用/贡献度)的概念:它根据每个 token 对偏好结果的贡献大小,来调制该 token 的 KL 正则化强度。论文从理论上推导出一个关键结论——有效的 token credit 应该正比于每个 token"隐式奖励"(implicit reward)的幅度。所谓隐式奖励,就是标准 DPO 前向传播中,策略模型与参考模型在某个位置的对数概率之差乘以 β,即 r̂_t = β(log π_θ − log π_ref)。这个量刻画了"这个 token 在多大程度上让当前回复区别于参考策略"。更关键的是,作者观察到这个隐式奖励信号在训练过程中会大幅演化——这意味着任何"静态"的 token credit(比如训练开始前一次性算好固定下来)都会随着训练推进越来越失配,这也是论文将方案命名为"自演化"(Self-Evolving)的由来。

实验结果

针对"静态 credit 会失配"的问题,Se-DPO 提出一套"活的"机制:不预先固定 credit,而是在每个训练步从模型自身演化的内部信号里实时推导。具体做法是把两个信号送进一个轻量校准网络(calibration network):一是 token 隐式奖励的绝对值 |r̂_t|(代表贡献的"强度"),二是参考模型在该位置的熵 H_ref,t(代表贡献的"置信度",熵越高说明该位置越不确定)。由于奖励信号在不同位置的可靠性并不均匀,Se-DPO 用"强度 + 置信度"两个维度共同校准。这个校准网络只是一层两层的 MLP(Linear(2,16)→ReLU→Linear(16,1)→Softplus),参数在所有 token 位置、chosen/rejected 两侧共享,再做一次均值归一化防止 credit 退化为全零。最关键的一点是:它不需要任何外部模型(比如额外的奖励模型),所有输入信号都来自标准 DPO 前向传播本身,因此计算开销极小——在 Llama-3.2-3B 上,DPO 训练耗时 97.1 分钟,Se-DPO 仅需 103.7 分钟,相对开销只有 +6.85%。

实验覆盖了不同规模、不同训练范式的模型:Llama-3-8B-Instruct(全参数微调)、Llama-3.2-3B-Instruct 与 Gemma-2-2B-it(LoRA 训练)。偏好数据来自 UltraFeedback 的 prompt,用 ArmoRM 奖励模型从 5 个候选响应里挑最高/最低分构建约 6 万对偏好对;对 Llama-3-8B 还额外用 PairRM 标注,以检验增益是否依赖某一特定奖励模型。结果相当可观:在 Llama-3-8B-Instruct(ArmoRM 标注)上,Se-DPO 拿到 AlpacaEval 2 胜率 50.6%、Arena-Hard 43.3%,相比 DPO 基线(40.8% / 36.2%)分别提升 +9.8 和 +7.1 个点;相比此前最强的相关基线 TGDPO(42.5% / 40.5%)也分别高出 +8.1 和 +2.8 个点。换用 PairRM 标注后,Se-DPO 仍以 47.2% / 42.6% 领先 DPO 的 41.7% / 30.4%,说明增益并非对某一种奖励模型的过拟合。小模型的 LoRA 设置下同样成立:Llama-3.2-3B 从 DPO 的 29.6% / 23.2% 提升到 34.2% / 28.8%,Gemma-2-2B 从 40.8% / 26.4% 提升到 44.4% / 29.6%。值得一提的是,作者还做了长度控制(LC)检验,Se-DPO 的长度控制胜率 47.4% 仍显著高于 DPO 的 38.2%——尽管 Se-DPO 的平均回复更长(2215 vs 1837 tokens),但长度控制后的优势依旧成立,说明提升并非单纯靠"写得更长"刷出来的。

对思陌大模型微调而言,Se-DPO 的启示直接落在「指令对齐」和「评估优化」两项核心能力上。第一,DPO 的均匀求和假设是几乎所有下游 DPO 变体(SimPO、TGDPO 等)共有的"隐性先验",Se-DPO 证明只要按 token 贡献重新加权,就能在不换数据、不加外部奖励模型的前提下拿到近 10 个点的 AlpacaEval 2 提升——这意味着思陌为客户做偏好对齐时,可以在现有 DPO 流水线上以约 +7% 的计算开销换取显著的对齐收益,是性价比极高的"升级补丁"。第二,token credit 的"自演化"思路提醒我们:对齐过程中的内部信号(隐式奖励、参考熵)本身就是可挖掘的富矿,与其外挂更昂贵的奖励模型,不如先榨干模型自身的反馈——这与思陌「评估优化」中"用多维评测而非单一指标"的理念一致。第三,从工程上看,校准网络只有两层 MLP、参数共享、零外部依赖,可无缝接入 LoRA 微调流程,为思陌在中小参数模型(3B 级)上的低成本对齐定制提供了一条可复用的技术路径。

参考文献

📄 论文原文信息

论文标题Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization
作者Wenxiao Zhao, Shu Wang, Ying Nian Wu
期刊arXiv / COLM 2026
发表时间2026-08-10
DOI10.48550/arXiv.2608.09568

论文原文信息地址:https://www.simolm.com/blog/2026-08-16-se-dpo-self-evolving-token-credit/