← 行业趋势
微调后模型安全护栏为何失守?DataRx缺失感知采样用1%数据把攻击成功率从59.23%降至13.70%

微调后模型安全护栏为何失守?DataRx缺失感知采样用1%数据把攻击成功率从59.23%降至13.70%

西北工业大学提出DataRx方法,用隐藏表示量化安全信号缺口来筛选安全样本。实验发现随机混入BeaverTails安全数据反而使Llama3-8B攻击成功率从20.24%飙升至59.23%,而DataRx仅用1%精选样本即降至13.70%,下游任务精度基本无损。

封面

研究背景:一个反直觉的安全退化现象

企业客户把通用大模型交给服务商做领域微调时,最常提的一个隐性诉求是:“别把模型微调坏了。“这里的"坏"通常指两件事——通用能力遗忘,以及安全护栏失效。前者业界已有大量研究,后者却长期停留在"多掺点安全数据就行"的经验层面。

来自 西北工业大学(Northwestern Polytechnical University) 的 Junbo Zhang、Qianli Zhou(通讯作者)、Xinyang Deng 和 Wen Jiang 在 2026 年 8 月 5 日提交的论文 DataRx 中,给出了一个让人警醒的实测结果:在 Llama3-8B-Instruct 上做任务微调,如果只用下游任务数据,七个任务上的平均攻击成功率(ASR)是 20.24%;而按业界惯例随机混入 1% 的 BeaverTails 安全数据后,ASR 不降反升,飙到了 59.23%

换句话说,随手掺安全数据这个"标准操作”,在特定数据源上可能让模型比不掺还危险近三倍。团队据此提出了核心问题:决定一条安全样本有没有用的原理是什么? 他们的假设是——安全样本的价值不在于它本身"有多安全”,而在于它是否恰好补上了目标模型当前缺失的那部分拒绝能力。这就是"缺失感知(missingness-aware)“这个名字的由来。

核心方法:用隐藏表示度量"安全信号缺口”

DataRx 的关键技术判断是:不要在离散 token 层面比较回答的安全性,而要到模型的高维隐藏表示空间里去量化差距。原因很直白——两个措辞完全不同的拒绝回答,在 token 层面看毫无关系,但在表示空间里可能指向同一个"拒绝方向"。

第一步:提取对比安全模式。 团队从 Circuit Breaker Dataset 中各取 100 条构造两个锚数据集:𝒟_r(有害指令 + 安全拒绝)与 𝒟_c(有害指令 + 不安全遵从)。在模型每一层 l 上,取 ⟨eos⟩ 位置隐状态的均值,分别得到拒绝中心 C_r^l遵从中心 C_c^l。这两个中心刻画了该层上"拒绝"与"服从"两种行为模式的表示锚点。

第二步:定义分层拒绝分数。 对任意样本 d,其在第 l 层的拒绝分为两个余弦相似度之差:

s^l(d) = cos(h^l(d), C_r^l) − cos(h^l(d), C_c^l)

跨全部 L 层取平均得到整体拒绝分 R(d) = (1/L) Σ s^l(d)。这个设计的巧妙之处在于用相对差值而非绝对相似度,天然抵消了不同层表示尺度的差异。

第三步:计算安全适应分数(SAS)。 这是缺失感知的核心。对每条候选安全样本 d_i^safe = (x_i, y_i^safe),先让目标模型自己对指令 x_i 生成一个原生响应 y_i^orig,构成原生样本对 d_i^orig,然后:

SAS_i = R(d_i^safe) − R(d_i^orig)

这个差值衡量的是"参考答案比模型自己的答案安全多少"。SAS 越高,说明模型在这条指令上的安全能力缺口越大,这条样本的教学价值也越高。反之,如果模型本来就会拒绝(R(d^orig) 已经很高),那这条样本再教一遍就是浪费预算。论文的案例分析给出了直观对照:一条询问破坏拉什莫尔山的指令 SAS = 0.2403(模型原生响应危险、参考答案拒绝),而一条模型已能自主拒绝的样本 SAS = −0.2714

第四步:Top-K 选样与混合微调。 按 SAS 降序取 Top-K,与任务数据按固定 100:1 比例混合(即安全数据仅占 1%),走标准 LoRA 微调(rank=16, alpha=32, dropout=0.05, lr=2e-4, 1 epoch)。整套流程不改训练算法,纯粹是数据侧的即插即用改造。

技术原理

实验数据:ASR 大幅下降,任务精度几乎无损

评测覆盖三个主流开源模型(Llama3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.2)、七个下游任务(GSM8K、MATH、HellaSwag、WinoGrande、MedQA、Magicoder、DocBlocks)和三个安全基准(DirectHarm4、HarmBench、HEx-PHI,ASR 取三者均值)。

BeaverTails 数据源上的主结果。 这是最能体现方法价值的一组,因为 BeaverTails 中低质量安全样本较多,随机采样的破坏性最强:

模型 仅下游数据 随机采样 DataRx
Llama3-8B-Instruct 20.24% 59.23% 13.70%
Qwen2.5-7B-Instruct 19.06% 50.08% 12.29%
Mistral-7B-Instruct-v0.2 78.75% 88.31% 62.43%

三个模型上随机采样全部造成了安全恶化(Llama3 +38.99pp、Qwen2.5 +31.02pp、Mistral +9.56pp),而 DataRx 用同样 1% 的预算全部实现了净改善。

高质量数据源上依然有效。 在筛选更严格的 Aegis 数据集上,随机采样本身表现尚可,但 DataRx 仍能进一步压缩:Qwen2.5 从 13.77% 降至 4.64%(降幅 66%),Llama3 从 7.50% 降至 4.31%,Mistral 从 37.77% 降至 29.96%。这说明 SAS 的增益不依赖于"数据源本身很脏"这一前提。

下游任务精度基本无损。 这是工程落地的关键约束。在全部配置下,加入安全数据后的任务准确率波动均在 ±2% 以内。以 Llama3 为例,GSM8K 从仅下游数据的 66.19% 变为 DataRx 的 66.49%(不降反微升),MATH 21.18%→21.50%,DocBlocks 82.90%→83.28%。安全性提升没有以牺牲任务效用为代价。

消融验证"缺失感知"的必要性。 团队对比了两种选样信号:(a) 只看参考答案的拒绝分 R(d^safe),(b) 看参考答案与原生响应的差值(完整 SAS)。在全部 6 个模型×数据源组合上,(b) 的 ASR 均低于 (a)——Llama3+Aegis 从 3.36% 降至 0.67%,Qwen2.5+Aegis 从 2.26% 降至 0.95%,Mistral+BeaverTails 从 45.36% 降至 40.22%。这直接证明了"参考模型自身缺口"这一步不可省略。

一个反常识的发现。 团队还测试了"选最长回答"这一朴素启发式基线,结果在 BeaverTails 上把 Llama3 的 ASR 推高到 50.19%。分析显示高 SAS 样本的响应长度往往更短,而 Bottom-100 低价值样本反而更长——回答长度完全不是安全样本价值的可靠代理指标。此外,DataRx 可与现有安全数据合成方法 GR-SAP 叠加:在合成数据上 Llama3 的 ASR 从随机采样的 11.99% 进一步降至 3.40%

实验结果

商业启示

DataRx 触及的是大模型定制交付中一个高频却被低估的风险点,对思陌大模型微调的多条业务线有直接参考价值:

  • 数据工程服务:这篇论文最重要的结论是"安全数据不能随便掺"。思陌在为客户构建领域微调数据集时,可以把 SAS 打分作为安全样本入库的准入门槛——同样是 1% 的数据预算,选对样本和选错样本之间的 ASR 差距可达 45 个百分点。更关键的是,SAS 计算只需要目标模型做一轮推理加隐状态提取,不需要额外训练,边际成本极低,适合作为标准化质检环节嵌入交付流水线。

  • 指令微调与对齐:安全退化本质上是一种"对齐税"。DataRx 提供了一个可量化、可诊断的视角:先测出模型的安全能力缺口分布,再针对性补齐,而不是盲目加大安全数据比例。论文的混合比例消融也提示了一个实务细节——随机混合时安全数据加得越多 ASR 反而越高,而精选样本加过量则可能过拟合导致 ASR 回升,配比需要按模型和数据源实测确定。

  • 模型评估优化:三个模型的基线 ASR 差异巨大(Mistral 仅下游数据时已达 78.75%,是 Llama3 的近四倍),说明不同基座的安全韧性完全不在一个量级。思陌在为客户做基座选型时,应把"微调后安全稳定性"纳入评估维度,而不只看任务榜单分数。对于 Mistral 这类安全韧性偏弱的基座,即便用上 DataRx,ASR 仍高达 62.43%,意味着数据侧防御存在天花板,需要叠加推理侧防护。

  • 基座模型微调:本方法在标准 LoRA 流程上即插即用,不改训练算法、不加训练成本,对已有微调管线的改造成本几乎为零。这类"低侵入、高收益"的工程改进,正是私有化交付场景中最容易规模化推广的技术选择。

对企业客户而言,这项研究传递的信号很明确:领域微调不是纯粹的能力叠加,它同时在悄悄侵蚀模型出厂时的安全属性。而修复这个侵蚀,靠的不是往里堆更多安全数据,而是堆对数据。


参考文献

  • arXiv: 2608.04322 — DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning
  • DOI: 10.48550/arXiv.2608.04322 — Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang, Northwestern Polytechnical University, 2026-08-05

📄 论文原文信息

论文标题DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning
作者Junbo Zhang, Qianli Zhou (通讯作者), Xinyang Deng, Wen Jiang — 西北工业大学
期刊arXiv preprint (arXiv:2608.04322), cs.CL
发表时间2026-08-05
DOI10.48550/arXiv.2608.04322

论文原文信息地址:https://www.simolm.com/blog/2026-08-07-datarx-missingness-aware-safety-sampling/