← 行业趋势
推理大模型为什么一量化到三值就崩?ScaleQ-1.58 「自推理校准」方法解读

推理大模型为什么一量化到三值就崩?ScaleQ-1.58 「自推理校准」方法解读

英特尔中国研究院提出 ScaleQ-1.58 三值后训练量化框架,通过 AYOT 自推理校准方法,仅用 4M token 即可将推理大模型量化为 1.58 位,Qwen3-4B 三值化后仍保持 45.6% 平均推理精度,较传统校准方案提升超 42 个百分点。

封面

大模型推理部署一直面临一个核心矛盾:全精度模型(FP16/BF16)精度高但显存和算力成本惊人,量化则能大幅降低部署门槛,但在极低位宽——尤其是 1.58 位(三值)——推理类模型几乎无一例外地发生性能崩塌。英特尔中国研究院(Intel Labs China)于 2026 年 8 月 2 日提交的 ScaleQ-1.58 框架针对这一问题提出了一个简洁而深刻的解决方案:让模型在量化过程中「关注自己的思维」(Attend to Your Own Thoughts, AYOT),用模型自身的推理链来引导三值化过程。

研究背景:从 BitNet 到推理模型的 PTQ 之困

自微软 2024 年提出 BitNet b1.58 以来,1.58 位(三值 {-1, 0, 1})大模型代表了模型压缩的终极方向:理论上可消除几乎所有浮点乘法运算,将推理成本降低一个数量级。然而 BitNet 需要从零开始训练(4T tokens),对于已有的大量预训练推理模型(如 Qwen3、DeepSeek 系列)并不适用。

后训练量化(PTQ)提供了更经济的路径——直接对预训练模型进行位宽压缩。但问题在于:现有的 PTQ 方法(包括最新的 CAT-Q 可微分三值化)在推理任务上表现惨淡。以 Qwen3-4B 为例,使用传统校准方案(如 C4/WikiText2 通用文本)进行三值化后,数学推理任务(Math-500)得分直接从全精度的 96.80 跌至 0.00,编程任务(HumanEval+)同样归零。这并非模型能力的根本性丧失,而是校准方案与推理任务之间出现了结构性错配。

核心方法:AYOT 自推理校准

ScaleQ-1.58 的核心创新是 AYOT 校准策略,其逻辑直接但极具洞察力:推理模型的"思维过程"本身就是最优的量化校准信号

AYOT 工作流程分为三步:

  1. 领域特定采样:从 MetaMathQA 和 OpenCodeInstruct 数据集中采样数学与编程问题
  2. 自推理生成:让待量化的高精度模型自身为每个问题生成完整的思维链(CoT)推理轨迹和最终答案
  3. 拼接校准:将 [问题, 推理轨迹, 答案] 三元组作为量化优化过程的上下文输入,引导三值化权重向保留推理能力的方向收敛

研究团队设计了四种校准方案进行对照实验,结果极具说服力——在 Qwen3-4B 上只用 4M 校准 token:

校准方案 Math-500 GSM8K HumanEval+ MBPP+ 五任务平均
通用文本(C4) 0.00 14.48 0.00 0.00 3.44
领域问答对 24.20 28.65 17.88 11.38 17.43
更强模型生成 31.80 30.78 16.46 14.29 20.06
AYOT(自生成) 58.40 61.56 53.98 39.15 45.60

AYOT 不仅在绝对指标上碾压其他方案(较领域问答对提升 28.17 个百分点),还有一个反直觉的发现:自生成的推理链比用更强模型(DeepSeek-R1-671B)生成的推理链效果更好,AYOT 相对更强模型方案的优势达 25.54 个百分点。研究人员将此归因于"分布匹配"——自生成的 CoT 天然位于目标模型的输出分布内,量化优化时模型更容易保持这一分布。

技术原理

实验发现:可扩展的量化新范式

ScaleQ-1.58 展示出令人瞩目的可扩展性,覆盖了从 1.7B 到 235B 的广泛模型规模:

跨模型扩展(W1.58A16, 4M tokens):三值化 Qwen3-1.7B 在数学和编程任务上的平均性能达到 BitNet b1.58 2B4T(从 4T token 从头训练)的 90.52%,而校准 token 用量仅为后者的百万分之一。更令人兴奋的是,三值化 Qwen3-4B 的平均性能已超越 BitNet b1.58 2B4T(绝对提升 8.97%),Qwen3-32B 三值化后在 GSM8K 上达到 87.34,几乎追平全精度水平。

校准 Token 扩展(Qwen3-4B):从 256K 到 16M token,模型性能持续提升,未出现平台效应。消融实验进一步揭示:增加校准数据的多样性(从 256K 到 2M token 带来 13.86% 提升)远优于单纯增加优化迭代次数(5.49% 提升)。

跨位宽泛化:AYOT 不仅适用于三值量化——将其与 SliderQuant 结合,2-bit 量化下的 Qwen3-4B 五任务平均从 3.44(C4 校准)跃升至 48.43;即使在 4-bit 下也有显著增益(全职精度 94.85 vs 传统 87.47)。

架构兼容性:ScaleQ-1.58 在 Dense 和 MoE 架构上均有效,包括 Qwen3-235B-A22B(MoE)和 DeepSeek-R1-Distill-Llama-70B。MoE 模型对三值化更敏感是当前的主要限制之一。

实验结果

商业启示:推理部署成本的新可能性

ScaleQ-1.58 为思陌大模型微调的推理部署服务方向提供了明确的商业启示:

第一,三值权重理论上有望将显存占用压缩至全精度的约 1/10(W1.58 vs W16),这意味着原本需要 4×A100 才能部署的 30B 级模型,理论上可在单张 A100 上运行。对于面向中小企业的私有化推理部署,成本敏感度极高,这是关键卖点。

第二,AYOT 校准策略可纳入模型评估优化服务管线:对微调后的客户模型,在量化部署前自动执行自推理校准,确保量化版本保留微调获得的能力。这是差异化服务的重要增值点。

第三,校准数据多样性优于迭代次数的发现,指导了数据工程服务中校准数据集的设计原则——少量但领域对齐的数据,胜过海量但不相关的通用文本。对于客户的垂直领域微调模型,可生成专属的 AYOT 校准集。

ScaleQ-1.58 并非万能——MoE 模型的量化损失仍然偏大,且校准数据域需要针对下游任务精心选择。但它在"推理能力保留"和"实验成本"之间建立的平衡点,为推理大模型的低成本部署打开了新窗口。


参考文献

  1. Wang S, Li C, Kang Y, et al. Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization. arXiv preprint, 2026. arXiv: 2608.01078 DOI: 10.48550/arXiv.2608.01078
  2. Ma S, Wang H, Ma L, et al. The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits. arXiv preprint, 2024. arXiv: 2402.17764
  3. ScaleQ-1.58 项目代码:IntelChina-AI/BitTern

📄 论文原文信息

论文标题Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization
作者Shigeng Wang, Chao Li, Anbang Yao
期刊arXiv preprint, arXiv:2608.01078
发表时间2026-08-02
DOI10.48550/arXiv.2608.01078

论文原文信息地址:https://www.simolm.com/blog/2026-08-05-scaleq-ayot-ternary-quantization/