推理大模型为什么一量化到三值就崩?ScaleQ-1.58 「自推理校准」方法解读
英特尔中国研究院提出 ScaleQ-1.58 三值后训练量化框架,通过 AYOT 自推理校准方法,仅用 4M token 即可将推理大模型量化为 1.58 位,Qwen3-4B 三值化后仍保持 45.6% 平均推理精度,较传统校准方案提升超 42 个百分点。
大模型推理部署一直面临一个核心矛盾:全精度模型(FP16/BF16)精度高但显存和算力成本惊人,量化则能大幅降低部署门槛,但在极低位宽——尤其是 1.58 位(三值)——推理类模型几乎无一例外地发生性能崩塌。英特尔中国研究院(Intel Labs China)于 2026 年 8 月 2 日提交的 ScaleQ-1.58 框架针对这一问题提出了一个简洁而深刻的解决方案:让模型在量化过程中「关注自己的思维」(Attend to Your Own Thoughts, AYOT),用模型自身的推理链来引导三值化过程。
研究背景:从 BitNet 到推理模型的 PTQ 之困
自微软 2024 年提出 BitNet b1.58 以来,1.58 位(三值 {-1, 0, 1})大模型代表了模型压缩的终极方向:理论上可消除几乎所有浮点乘法运算,将推理成本降低一个数量级。然而 BitNet 需要从零开始训练(4T tokens),对于已有的大量预训练推理模型(如 Qwen3、DeepSeek 系列)并不适用。
后训练量化(PTQ)提供了更经济的路径——直接对预训练模型进行位宽压缩。但问题在于:现有的 PTQ 方法(包括最新的 CAT-Q 可微分三值化)在推理任务上表现惨淡。以 Qwen3-4B 为例,使用传统校准方案(如 C4/WikiText2 通用文本)进行三值化后,数学推理任务(Math-500)得分直接从全精度的 96.80 跌至 0.00,编程任务(HumanEval+)同样归零。这并非模型能力的根本性丧失,而是校准方案与推理任务之间出现了结构性错配。
核心方法:AYOT 自推理校准
ScaleQ-1.58 的核心创新是 AYOT 校准策略,其逻辑直接但极具洞察力:推理模型的"思维过程"本身就是最优的量化校准信号。
AYOT 工作流程分为三步:
- 领域特定采样:从 MetaMathQA 和 OpenCodeInstruct 数据集中采样数学与编程问题
- 自推理生成:让待量化的高精度模型自身为每个问题生成完整的思维链(CoT)推理轨迹和最终答案
- 拼接校准:将
[问题, 推理轨迹, 答案]三元组作为量化优化过程的上下文输入,引导三值化权重向保留推理能力的方向收敛
研究团队设计了四种校准方案进行对照实验,结果极具说服力——在 Qwen3-4B 上只用 4M 校准 token:
| 校准方案 | Math-500 | GSM8K | HumanEval+ | MBPP+ | 五任务平均 |
|---|---|---|---|---|---|
| 通用文本(C4) | 0.00 | 14.48 | 0.00 | 0.00 | 3.44 |
| 领域问答对 | 24.20 | 28.65 | 17.88 | 11.38 | 17.43 |
| 更强模型生成 | 31.80 | 30.78 | 16.46 | 14.29 | 20.06 |
| AYOT(自生成) | 58.40 | 61.56 | 53.98 | 39.15 | 45.60 |
AYOT 不仅在绝对指标上碾压其他方案(较领域问答对提升 28.17 个百分点),还有一个反直觉的发现:自生成的推理链比用更强模型(DeepSeek-R1-671B)生成的推理链效果更好,AYOT 相对更强模型方案的优势达 25.54 个百分点。研究人员将此归因于"分布匹配"——自生成的 CoT 天然位于目标模型的输出分布内,量化优化时模型更容易保持这一分布。
实验发现:可扩展的量化新范式
ScaleQ-1.58 展示出令人瞩目的可扩展性,覆盖了从 1.7B 到 235B 的广泛模型规模:
跨模型扩展(W1.58A16, 4M tokens):三值化 Qwen3-1.7B 在数学和编程任务上的平均性能达到 BitNet b1.58 2B4T(从 4T token 从头训练)的 90.52%,而校准 token 用量仅为后者的百万分之一。更令人兴奋的是,三值化 Qwen3-4B 的平均性能已超越 BitNet b1.58 2B4T(绝对提升 8.97%),Qwen3-32B 三值化后在 GSM8K 上达到 87.34,几乎追平全精度水平。
校准 Token 扩展(Qwen3-4B):从 256K 到 16M token,模型性能持续提升,未出现平台效应。消融实验进一步揭示:增加校准数据的多样性(从 256K 到 2M token 带来 13.86% 提升)远优于单纯增加优化迭代次数(5.49% 提升)。
跨位宽泛化:AYOT 不仅适用于三值量化——将其与 SliderQuant 结合,2-bit 量化下的 Qwen3-4B 五任务平均从 3.44(C4 校准)跃升至 48.43;即使在 4-bit 下也有显著增益(全职精度 94.85 vs 传统 87.47)。
架构兼容性:ScaleQ-1.58 在 Dense 和 MoE 架构上均有效,包括 Qwen3-235B-A22B(MoE)和 DeepSeek-R1-Distill-Llama-70B。MoE 模型对三值化更敏感是当前的主要限制之一。
商业启示:推理部署成本的新可能性
ScaleQ-1.58 为思陌大模型微调的推理部署服务方向提供了明确的商业启示:
第一,三值权重理论上有望将显存占用压缩至全精度的约 1/10(W1.58 vs W16),这意味着原本需要 4×A100 才能部署的 30B 级模型,理论上可在单张 A100 上运行。对于面向中小企业的私有化推理部署,成本敏感度极高,这是关键卖点。
第二,AYOT 校准策略可纳入模型评估优化服务管线:对微调后的客户模型,在量化部署前自动执行自推理校准,确保量化版本保留微调获得的能力。这是差异化服务的重要增值点。
第三,校准数据多样性优于迭代次数的发现,指导了数据工程服务中校准数据集的设计原则——少量但领域对齐的数据,胜过海量但不相关的通用文本。对于客户的垂直领域微调模型,可生成专属的 AYOT 校准集。
ScaleQ-1.58 并非万能——MoE 模型的量化损失仍然偏大,且校准数据域需要针对下游任务精心选择。但它在"推理能力保留"和"实验成本"之间建立的平衡点,为推理大模型的低成本部署打开了新窗口。
参考文献
- Wang S, Li C, Kang Y, et al. Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization. arXiv preprint, 2026. arXiv: 2608.01078 DOI: 10.48550/arXiv.2608.01078
- Ma S, Wang H, Ma L, et al. The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits. arXiv preprint, 2024. arXiv: 2402.17764
- ScaleQ-1.58 项目代码:IntelChina-AI/BitTern
📄 论文原文信息
| 论文标题 | Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization |
| 作者 | Shigeng Wang, Chao Li, Anbang Yao |
| 期刊 | arXiv preprint, arXiv:2608.01078 |
| 发表时间 | 2026-08-02 |
| DOI | 10.48550/arXiv.2608.01078 |
论文原文信息地址:https://www.simolm.com/blog/2026-08-05-scaleq-ayot-ternary-quantization/