← 行业趋势
大模型自我提升如何判断真假?Phantom Gains 控制组审计揭示七个测量陷阱

大模型自我提升如何判断真假?Phantom Gains 控制组审计揭示七个测量陷阱

Qwen3-8B 三轮 rank-32 LoRA 自训练对照冻结控制组审计,发现 7 类测量失败、每一项在缺失控制组时都会反转结论;外部蒸馏确实能提升基座模型罕见触及的问题,三类自训练则不能,且自训练以显著高于测量下限的速率破坏基线已解问题。

“自我提升”(self-improvement)是后训练阶段最诱人的叙事之一——让模型拿自己的输出当训练数据,像滚雪球一样越滚越强。但怎么判断它真的变强了?爱尔兰都柏林大学(University College Dublin)的 Cheng Xu、Nan Yan、Liming Chen 与 M-Tahar Kechadi 团队在一篇新论文里给出了一个让人警醒的回答:很多被报道的"提升",很可能只是测量假象。

封面

他们指出,如今评判一个模型是否"自我提升",早已不再只看平均准确率,而是看它具体在哪些单题上"进"、哪些单题上"退"——这种迁移(transition)层面的跟踪,本质上是把两个含噪估计做差,天然脆弱。为了坐实这一点,他们对 Qwen3-8B 上三轮 rank-32 LoRA 自训练做了审计,同时让一个冻结的控制组模型穿过完全相同的评测流水线做对照,最终定位出 7 类测量失败——每一类在去掉控制组之后,都会把原本的结论彻底翻转。

核心方法:给"提升"装上一根对照的锚

这篇工作最核心的方法学贡献,是把"控制组"这个在医学、社会科学里早已是标配的工具,搬到了大模型自我提升评测里。作者不是简单地比较"自训练前 vs 自训练后"的平均分,而是搭了一套**多臂对照(multi-arm)**的梯形实验:treatment 是各种自训练方案,control 是冻结的基座模型,两者被推过一模一样的流水线——同样的数据流、同样的评测、同样的采样预算。

有了这根对照的锚,那些原本"看起来很美"的统计量就露了馅。作者列举的 7 个陷阱,个个都有杀伤力:

  1. 单次贪心解码就能"制造"能力变化。 用一次贪心采样建的能力账本(ledger),在根本没训练过的模型上也能制造出"能力此消彼长"的假象,作者定位到这主要是**推理批处理(inference batching)**带来的伪影。
  2. “扩展统计量"会给外行模型打高分。 那个用来区分"获得新能力"与"已有能力锐化"的 expansion statistic,竟然给同一个未训练模型打出了 0.280 的迁移速率。
  3. “自然阈值修复"不可复现。 在冻结对照本身已有的比较上重新估计,它的 null 始终是非零的——说明这套修复本身就没踩在正确的零点上。

作者用一套逐题精确检验 + 错误发现率(FDR)控制的方案替换了上述统计量:在每一个留出的 replicate 上,它都检不出任何东西,并且在多重检验规则、错误率、池大小变化下保持稳定。换句话说,之前"看到"的不少提升,很可能从来就不存在。

技术原理

实验结果:蒸馏是真的,自训练存疑

把这套审计方法落到实际的"武器"对比上,结论相当干净利落。作者构建了一个在数据流、数据量、评测三方面都对齐的梯形多臂实验,得到两条关键发现:

  • 外部蒸馏有效,三类自训练无效。 外部知识蒸馏能提升基座模型"很少触及"的那些问题,而三种形式的自训练(self-training)都不能。更关键的是,一个回归检验拒绝了"这种不对称只是蒸馏更大总体增益的副产物"这一替解释——p 值小于 10⁻⁸,说明差异是结构性的,不是规模红利。
  • 自训练在"破坏"基线已解的问题。 在基座模型从未触及的那一小撮问题上,证据并不确定;但自训练会以显著高于测量下限(measured floor)的速率,把基座本来已经做对的问题搞坏。

这一反差直指一个被长期忽视的事实:自训练的"进步”,很可能有一部分来自测量噪声,而它真实的破坏性副作用反而被平均分掩盖了。

实验结果

商业启示:微调交付,不能只看平均分

这篇论文给思陌大模型微调的业务提了个醒,尤其在模型评估优化这条线上,方法学价值直接可落地:

  • 交付前必须上控制组。 给客户交付微调模型时,别再用"微调前 vs 微调后"的平均分说话。用一个冻结基线穿透同一套评测,是成本极低、却能拦下大量"假增益"的第一道闸。
  • 迁移级审计要配 null。 如果客户关心的是"到底新学会了哪些题、退化了哪些题”,那么每一个统计量(扩展率、迁移率、保留率)都要单独测一个 null——好消息是,这些 null 可以零新增实验成本地从多臂实验已有的基线 replicate 里构建出来(但要注意:从太少的 replicate 里估不出来)。
  • 自训练数据要警惕测量伪影。 对思陌的数据工程而言,用模型自己生成的数据做自训练时,必须意识到"蒸馏"和"自训练"并非等价:前者带来的是真本事,后者可能只是噪声的搬运。选型时优先外部蒸馏,自训练则要谨慎评估其对已解问题的破坏。

一句话总结:当所有人都在追逐"自我提升"的曲线时,这篇论文提醒我们先把尺子校准——没有控制组的提升报告,都该打一个问号。

参考文献

  • arXiv: 2608.20290 — Phantom Gains: Auditing Self-Improvement Against a Measured Null

📄 论文原文信息

论文标题Phantom Gains: Auditing Self-Improvement Against a Measured Null
作者Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi
期刊arXiv (cs.AI / cs.CL)
发表时间2026-08-20

论文原文信息地址:https://www.simolm.com/blog/2026-08-25-phantom-gains-self-improvement-audit/