← 行业趋势
大模型量化后精度如何保住?REAL-Q 端到端损失对齐量化方法解析

大模型量化后精度如何保住?REAL-Q 端到端损失对齐量化方法解析

REAL-Q 用动态块级梯度下降替代传统闭式二阶求解,在 W4A16 下将 LLaMA-3.1 与 Qwen3 的端到端 KL 散度最高降低约 49%,为低比特大模型部署提供了新范式。

封面

大语言模型的落地,绕不开一个现实问题:显存和带宽。把权重从 16 位浮点压缩到 4 位整数,模型体积能缩小约 4 倍,推理成本大幅下降,但精度损失始终是量化部署的"阿克琉斯之踵"。主流训练后量化(Post-Training Quantization, PTQ)方法——如 GPTQ 及其衍生变体——为了能在数学上解析求解,普遍对全局损失做了重度近似,导致量化误差在层与层之间逐级累积,最终在业务指标上"现形"。近日,由 Qian Zhang、Yaoming Li 等 12 位研究者组成的团队在 arXiv 上发布了 REAL-Q(Real-time E2E-loss Aligned LLM Quantization),提出一种全新的端到端损失对齐量化范式,用动态块级梯度下降替代传统的闭式二阶求解,把量化从"逐层近似"升级为"全局对齐"。

问题根源:被冻结的 Hessian 与"信息错位"

REAL-Q 的核心洞察,在于指出传统 PTQ 方法的一个根本缺陷——信息错位(information misalignment)。GPTQ、GPTAQ、GuidedQuant 等方法都遵循同一套路:对每一层单独求解一个闭式二阶优化器。为了保持解析可解,它们不得不丢弃跨通道耦合、把输出行池化成组,并在整层范围内冻结 Hessian 矩阵。问题在于,量化是逐列推进的,损失景观会随着每一列的更新而不断变化,而冻结的 Hessian 无法随之刷新,导致优化方向与实际损失下降方向逐渐脱节。

换句话说,传统方法优化的是一系列"局部的、被近似过的"代理目标,它们与模型真实的端到端损失之间,存在一条越来越宽的鸿沟。论文通过一个几何实验直观地呈现了这一点:在 Qwen3-0.6B 上测量各代理损失的梯度与真实端到端 KL 散度梯度的平均余弦相似度,结果 GPTQ/GPTAQ 的逐层 MSE 目标、GuidedQuant 的显著性加权 MSE 目标,对齐度都接近零;而 REAL-Q 的全 Fisher 矩阵代理始终与真实梯度保持高对齐度,满足理论上的下降条件。这解释了为什么"逐层都优化得很好",最终拼起来却损失惨重。

技术原理

解法:每量化 128 列,就做一次动态修正

REAL-Q 的做法是干脆放弃"解析可解"这个约束。它构造一个与端到端全局损失对齐的代理目标,然后每量化完一个 128 列的块,就用 Adam 做一次细粒度的动态块级梯度下降来修正误差,同时引入滑动窗口机制让跨层过渡更平滑,抑制误差在网络中的传播。这种"更重"的优化策略,换来的是显著的精度回报。

在 LLaMA-3.1-8B/70B 与 Qwen3-0.6B~32B 共 7 个模型、W4A16 设置下,REAL-Q 全部取得了最低的端到端 KL 散度。其中最显著的 Qwen3-1.7B,KL 从 11.9 降至 6.07,相对降幅约 49%;Qwen3-4B 也从 9.50 降至 5.44,降幅约 43%。即使在大体量模型上,LLaMA-3.1-70B 的 KL 也从 15.1 降至 14.3,把困惑度进一步压到 3.30。

低比特下的含金量:W2A16 与联合量化

真正考验方法成色的是超低比特场景。在 W2A16 设置下,Qwen3-8B 的下游任务平均精度达到 49.28,比最强的 GuidedQuant 高出 8.22 个百分点;在权重-激活-KV 联合量化的 W2A4KV4 极端场景中,激活感知(activation-aware)的 REAL-Q 把 KL 从 106 压到 76.7、困惑度从 30.75 降到 19.68。一个值得注意的细节是:在 W2A4KV4 下,如果关闭激活感知,REAL-Q 反而比基线更差(KL 127),这提醒工程实践者——位宽越低,激活感知越不是可选项,而是刚需

消融实验还提炼出一条关键的工程经验:列块大小 B 是影响最大的超参数。把 B 从 128 增大到 512,KL 会从 5.44 恶化到 6.57,印证了"更细粒度的动态修正"才是缓解误差累积的关键。滑动窗口与激活损失裁剪也各自贡献了可观的增益。

实验结果

商业启示:把量化纳入"评估优化"的一体化交付

对思陌大模型微调而言,REAL-Q 的价值直接落在「推理部署服务」与「模型评估优化」两条业务线上。客户做基座微调或领域适配后,往往面临"训得好、部署贵"的困境:全参数微调出的模型要上生产,就绕不开量化压缩,而压缩掉的那点精度,恰恰是客户最在意的业务指标。REAL-Q 的端到端损失对齐思路,意味着我们在做「领域适配 + 推理部署」一体化交付时,可以把量化纳入"评估优化"环节整体设计——用 KL 散度与下游任务精度(而非单一的困惑度)来度量压缩质量,并在 W2A16、W4A4KV4 这类超低比特场景下,为客户争取更高的精度天花板。这是一条能把"降本"与"保质"同时写进交付承诺的技术路径。

参考文献

📄 论文原文信息

论文标题REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent
作者Qian Zhang, Yaoming Li, Zhewen Tan, et al.
期刊arXiv preprint (cs.LG / cs.AI)
发表时间2026-08-30
DOI10.48550/arXiv.2609.00049

论文原文信息地址:https://www.simolm.com/blog/2026-09-09-realq-e2e-quantization/