微调 7B 大模型最少要几个参数?TinyLoRA 只用 13 个参数把 GSM8K 拉到 91% 的方法解析
Meta FAIR 论文《Learning to Reason in 13 Parameters》提出 TinyLoRA,把 LoRA 可训练参数压缩到极限:仅 13 个参数(26 字节)就让 Qwen2.5-7B-Instruct 在 GSM8K 上从 88.2 升到 91.8,六项数学基准平均从 40.3 升到 50.1,且强化学习(GRPO)在低参数区远胜监督微调(SFT)。
微调一个 7B 大模型,最少要动多少个参数?直觉上的答案是"百万级"——标准 LoRA 在 rank=8 下,光一个 7B 模型就要训练约 4000 万个参数。但 Meta FAIR 的研究者 John X. Morris、Niloofar Mireshghallah 等人给出了一个近乎挑衅的数字:13 个。他们在论文《Learning to Reason in 13 Parameters》(arXiv:2602.04118)中提出 TinyLoRA,把 LoRA 一路压缩到"低于秩 1"的极限,配合强化学习(GRPO),只用 13 个可训练参数——总共 26 个字节——就让 Qwen2.5-7B-Instruct 在 GSM8K 数学推理上从 88.2 分涨到 91.8 分,逼近全量微调的 91.7 分。这项来自 Meta FAIR(合作机构含康奈尔大学、卡内基梅隆大学)的工作,重新定义了"微调"到底在改什么。
核心方法:把可训练参数压成一个共享向量
要理解 TinyLoRA 为什么能这么省,得先看清标准 LoRA 的"下限"卡在哪。经典 LoRA 把权重更新写成 ΔW = B·A,A、B 是两个低秩矩阵;后来的 LoRA-XS 更进一步,用冻结权重的奇异值分解(SVD)因子 U、Σ、V 作骨架,只训练中间一个 r×r 的小矩阵——但即便如此,这个矩阵仍需要至少 r² 个参数,而且每个模块各训各的。LoRA 系方法在参数化形式上的共同约束是:可训练参数没法低于模型的隐藏维度,rank 再小也小不过 rank=1。
TinyLoRA 的"关键一刀"在于:它把每个模块里那个可训练矩阵,替换成一个极低维的共享向量 v。这个向量通过一组预冻结的随机投影矩阵 Pᵢ 映射回各模块的权重空间,再叠加到冻结的 SVD 骨架上。于是训练对象从"每个模块一个矩阵"缩减成"全模型一个向量",配合跨层、跨模块的激进平铺共享(weight tying)——无论注意力层的 Query 投影还是 MLP 的 Gate 投影,560 个适配位置共享同一个 v——参数复杂度骤降到 O(1) 量级。在极端情况下,全网只需训练 1 个参数。作者把这种形态称为 “rank below one”(低于秩 1):每个模块的有效秩被摊薄到 0.023,突破了传统低秩适配的任何理论下界。
这里有个反直觉的细节:在如此极端的压缩下,参数的数值精度比数量更重要。实验发现,用 FP32 存储这十几个参数,效果反而优于 bf16——当扰动微小到字节级,只有更高的数值分辨率才能承载那关键的微小调整。这也解释了为什么"26 字节"这个数字本身有分量:它不是噱头,而是精度与容量在极限处的权衡结果。
实验数据:RL 的信息密度,远高于 SFT
TinyLoRA 最惊人的发现藏在 SFT 与 RL 的对比里。用 GRPO 强化学习训练时,仅 13 个参数就能把 Qwen2.5-7B-Instruct 的数学能力大幅拉起:
| 指标(Qwen2.5-7B-Instruct) | 基座模型 | TinyLoRA 13 参数 | 全量微调 |
|---|---|---|---|
| GSM8K | 88.2 | 91.8 | 91.7 |
| MATH500 | 64.6 | 74.6 | 78.2 |
| AIME24 | 3.3 | 16.0 | 20.0 |
| AMC23 | 30.0 | 54.5 | 62.5 |
| 六项基准平均 | 40.3 | 50.1 | 55.2 |
13 个参数让六项数学基准平均分从 40.3 涨到 50.1,而 196 个参数(约 0.4KB)就达到 53.2,已经拿到全量微调(55.2)87% 的绝对提升。
对比之下,SFT 在低参数区几乎"失灵":同样的 13 个参数,SFT 只能把 GSM8K 拉到 83% 左右,120 个参数也才 84%,想要达到 RL 同等的效果,SFT 需要的参数量是 RL 的 100 到 1000 倍。作者从信息论角度给出了解释——SFT 的损失是对思维链里每一个 token 的密集监督,模型被迫去背措辞、格式、中间步骤这些大量冗余信息,26 字节的容量根本装不下;而 RL 的奖励是二元对错信号,天然过滤掉表达层面的噪声,只保留核心推理路径,信号密度高得多。
论文还揭示了一条新的 Scaling Law:模型越大,达到同一性能阈值所需的更新参数反而越少——要让 Qwen2.5-3B 达到 95% 的峰值精度需要约 350 个参数,7B 只需约 120 个,14B 更少。这支持了"能力激活"假说:微调不是往模型里注入新知识,而是像调旋钮一样把已有能力对齐到目标模式,基座越大,“旋钮"就可以做得越小越灵敏。
行业启示:微调范式从"注入"转向"唤醒”
对做大模型微调的工程师,TinyLoRA 的启示有三层。第一,在强化学习/指令对齐(GRPO、RLHF)场景,微调预算的分配逻辑该变了——与其纠结 LoRA rank 调多大、加多少 adapter 参数,不如把精力放在奖励信号的设计上,因为 RL 场景下"改对了哪几十个参数"比"改了多少参数"更重要。第二,这印证了数据工程里"信号质量 > 数据规模"的普适原则:RL 的稀疏对错信号比 SFT 的密集 token 信号更抗过拟合、更省容量,对预算有限的领域适配尤其有价值。第三,在推理部署侧,TinyLoRA 的增量只有几十字节,几乎可以忽略存储与分发成本,为"微型补丁式"的模型热更新、多租户快速适配打开了想象空间。当然,目前结论主要建立在数学推理基准上,能否泛化到知识密集型任务仍有待验证,但"13 个参数"这个实验,已经足够让我们重新审视微调的底层逻辑。
参考文献
- arXiv: 2602.04118 — Learning to Reason in 13 Parameters
- DOI: 10.48550/arXiv.2602.04118
📄 论文原文信息
| 论文标题 | Learning to Reason in 13 Parameters |
| 作者 | John X. Morris, Niloofar Mireshghallah, Mark Ibrahim, Saeed Mahloujifar |
| 期刊 | arXiv (cs.LG) |
| 发表时间 | 2026-02-05 |
| DOI | 10.48550/arXiv.2602.04118 |
论文原文信息地址:https://www.simolm.com/blog/2026-09-19-tinylora-13-parameters-reasoning/