HARGO:置信度调制的GRPO优化,破解多任务异构对齐难题
Tiangang Li团队提出HARGO框架,通过区分度-置信度双信号调制GRPO优势函数,在4类异构HPC任务上WinRate 54.62%、Data Race F1 91.30%,9种方法中全面最优,证明异构感知是GRPO后训练的关键突破口。
研究背景:GRPO的"一视同仁"困境
Group Relative Policy Optimization (GRPO) 已成为2026年大模型后训练的事实标准方法。从DeepSeek-R1到GLM-5.2,主流模型均采用GRPO替代PPO进行强化学习对齐,因其无需额外的价值网络、仅依赖组内对比即可计算优势函数,显著降低了训练成本。
然而,GRPO存在一个被长期忽视的结构性缺陷:它对所有训练样本施加均匀权重,完全无视任务间的巨大差异。Tiangang Li和Xiangbo Tian在7月30日提交的论文arXiv: 2607.28301中用一个生动的实验揭示了这个问题的严重性:同一SFT模型在C/C++数据竞争检测上分类准确率达88.65%,其MLPerf基准问答却有65.9%的响应超过40字符——冗长但不精确。不同任务的答案长度相差58倍、奖励分布横跨三个数量级、SFT基础准确率差异巨大。在这种极度异构的场景下,GRPO的"一刀切"权重策略意味着:模型在简单任务上过度优化,浪费算力;在困难任务上学不到东西,对齐不足。
核心方法:区分度 × 置信度双信号调制
HARGO(Heterogeneity-Aware Reward-Guided Optimization)提出了一个优雅的解决方案:为每个训练响应计算个性化的优势权重,但不需要任何任务类型标签。
其核心机制是"置信度调制优势函数"(Confidence-Modulated Advantage),由两个正交信号构成:
**区分度信号(Discrimination Signal)**来自当前策略的组内奖励对比。对于同一prompt的k个响应,计算组内奖励的标准差或极差作为"可区分程度"。如果组内响应奖励波动大,说明该任务在当前策略下仍有显著优化空间,应加大权重;如果所有响应奖励几乎一致,说明模型已收敛或该任务本质上无法进一步区分,应降低权重。这个设计巧妙地利用GRPO已有的组内采样结构,零额外开销。
**置信度信号(Confidence Signal)**来自参考模型(SFT checkpoint)的对数概率。论文发现,参考模型对某个响应的对数概率越低,该响应对应的样本越"困难"——它偏离了SFT阶段学到的分布,需要RL阶段更强的优化信号来对齐。HARGO将这一概率映射为权重调制因子,困难样本获得更高权重。
两个信号相乘后直接调制GRPO的优势函数:A_modulated = w_disc * w_conf * A_original。调制后的优势指导策略梯度更新,整个过程无需人工定义任务类别、无需预设难度阈值,完全自动化。
实验结果:9种方法中的全面最优
论文在4类HPC任务上进行了系统评测——数据竞争检测(二分类)、MLPerf基准问答(事实性QA)、PLP语义生成(开放域生成)、通用代码推理——覆盖了从短答案分类到长文本生成的全谱系任务,形成了天然的异构测试场。
9种对比方法包括:标准SFT、标准GRPO、Reward-Weighted GRPO、几种基于token级重加权的变体,以及HARGO的消融版本(仅区分度信号、仅置信度信号)。核心结果如下:
- WinRate(综合胜率):HARGO达到54.62%,在所有方法中最高,比标准GRPO领先显著。WinRate衡量的是模型响应对人类偏好的综合贴合度,是衡量对齐质量的最直接指标。
- Data Race F1:91.30%,在SFT基线(88.65%)基础上提升2.65个百分点,同时纠正了SFT模型"冗长但不精确"的行为模式——HARGO训练的模型在MLPerf任务上响应简洁、准确。
- PLP Similarity:0.8558,语义生成质量最优,证明HARGO在保持生成多样性的同时提升了语义一致性。
- 消融实验:仅区分度信号和仅置信度信号各自均有效果,但完整HARGO显著优于任一单信号版本,证实两信号互补贡献。
最值得关注的是,HARGO在所有三项主指标上均取得最优——这在以往的多任务RL后训练中极为罕见。通常多任务优化的帕累托前沿意味着某些指标提升必然以另一些指标下降为代价,而HARGO实现了真正的"全面支配"。
商业启示:异构感知如何优化微调ROI
HARGO的方法论对大模型微调服务行业有直接的工程指导意义,尤其体现在思陌的两项核心业务上:
指令微调与对齐。客户实际场景中的数据往往天然异构:客服工单可能包含意图分类、答案检索、多轮对话、投诉处理等多种子任务,它们的奖励信号天然不同。传统GRPO对齐训练中,简单任务(如标准化问候回复)消耗大量优化步数却贡献极小收益,而困难任务(如复杂投诉安抚)因样本少、难度大而训练不足。HARGO的置信度调制机制可以在无监督条件下自动识别样本难度、动态调整优化权重,确保客户的训练预算花在"刀刃"上。
模型评估优化。区分度信号不仅可用于训练权重分配,还能作为模型能力的"诊断仪"。如果一个任务类别的组内区分度持续趋近于零,说明模型在该类别上已"学无可学"——此时应当引导客户将资源转向其他薄弱任务,或补充更多样化的训练数据。这种数据驱动的决策支持将模型评估从"事后打分"升级为"事中优化"。
从更宏观的视角看,HARGO代表的"异构感知训练"范式正成为RL后训练的下一阶段方向。在DeepSeek、OpenAI等头部机构逐步将GRPO推向生产环境的背景下,如何让GRPO在真实世界的多样化数据上稳定工作,是从实验室到工程化的关键一步。HARGO给出的答案是:让模型自己判断什么值得学。
参考文献
- Tiangang Li, Xiangbo Tian. HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks. arXiv: 2607.28301, 2026-07-30.
📄 论文原文信息
| 论文标题 | HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks |
| 作者 | Tiangang Li, Xiangbo Tian |
| 发表时间 | 2026-07-30 |
| DOI | 10.48550/arXiv.2607.28301 |