← 行业趋势
微调 7B 大模型最少要几个参数?TinyLoRA 只用 13 个参数把 GSM8K 拉到 91% 的方法解析

微调 7B 大模型最少要几个参数?TinyLoRA 只用 13 个参数把 GSM8K 拉到 91% 的方法解析

Meta FAIR 论文《Learning to Reason in 13 Parameters》提出 TinyLoRA,把 LoRA 可训练参数压缩到极限:仅 13 个参数(26 字节)就让 Qwen2.5-7B-Instruct 在 GSM8K 上从 88.2 升到 91.8,六项数学基准平均从 40.3 升到 50.1,且强化学习(GRPO)在低参数区远胜监督微调(SFT)。

封面

微调一个 7B 大模型,最少要动多少个参数?直觉上的答案是"百万级"——标准 LoRA 在 rank=8 下,光一个 7B 模型就要训练约 4000 万个参数。但 Meta FAIR 的研究者 John X. Morris、Niloofar Mireshghallah 等人给出了一个近乎挑衅的数字:13 个。他们在论文《Learning to Reason in 13 Parameters》(arXiv:2602.04118)中提出 TinyLoRA,把 LoRA 一路压缩到"低于秩 1"的极限,配合强化学习(GRPO),只用 13 个可训练参数——总共 26 个字节——就让 Qwen2.5-7B-Instruct 在 GSM8K 数学推理上从 88.2 分涨到 91.8 分,逼近全量微调的 91.7 分。这项来自 Meta FAIR(合作机构含康奈尔大学、卡内基梅隆大学)的工作,重新定义了"微调"到底在改什么。

核心方法:把可训练参数压成一个共享向量

要理解 TinyLoRA 为什么能这么省,得先看清标准 LoRA 的"下限"卡在哪。经典 LoRA 把权重更新写成 ΔW = B·A,A、B 是两个低秩矩阵;后来的 LoRA-XS 更进一步,用冻结权重的奇异值分解(SVD)因子 U、Σ、V 作骨架,只训练中间一个 r×r 的小矩阵——但即便如此,这个矩阵仍需要至少 r² 个参数,而且每个模块各训各的。LoRA 系方法在参数化形式上的共同约束是:可训练参数没法低于模型的隐藏维度,rank 再小也小不过 rank=1。

TinyLoRA 的"关键一刀"在于:它把每个模块里那个可训练矩阵,替换成一个极低维的共享向量 v。这个向量通过一组预冻结的随机投影矩阵 Pᵢ 映射回各模块的权重空间,再叠加到冻结的 SVD 骨架上。于是训练对象从"每个模块一个矩阵"缩减成"全模型一个向量",配合跨层、跨模块的激进平铺共享(weight tying)——无论注意力层的 Query 投影还是 MLP 的 Gate 投影,560 个适配位置共享同一个 v——参数复杂度骤降到 O(1) 量级。在极端情况下,全网只需训练 1 个参数。作者把这种形态称为 “rank below one”(低于秩 1):每个模块的有效秩被摊薄到 0.023,突破了传统低秩适配的任何理论下界。

技术原理

这里有个反直觉的细节:在如此极端的压缩下,参数的数值精度比数量更重要。实验发现,用 FP32 存储这十几个参数,效果反而优于 bf16——当扰动微小到字节级,只有更高的数值分辨率才能承载那关键的微小调整。这也解释了为什么"26 字节"这个数字本身有分量:它不是噱头,而是精度与容量在极限处的权衡结果。

实验数据:RL 的信息密度,远高于 SFT

TinyLoRA 最惊人的发现藏在 SFT 与 RL 的对比里。用 GRPO 强化学习训练时,仅 13 个参数就能把 Qwen2.5-7B-Instruct 的数学能力大幅拉起:

指标(Qwen2.5-7B-Instruct) 基座模型 TinyLoRA 13 参数 全量微调
GSM8K 88.2 91.8 91.7
MATH500 64.6 74.6 78.2
AIME24 3.3 16.0 20.0
AMC23 30.0 54.5 62.5
六项基准平均 40.3 50.1 55.2

13 个参数让六项数学基准平均分从 40.3 涨到 50.1,而 196 个参数(约 0.4KB)就达到 53.2,已经拿到全量微调(55.2)87% 的绝对提升

对比之下,SFT 在低参数区几乎"失灵":同样的 13 个参数,SFT 只能把 GSM8K 拉到 83% 左右,120 个参数也才 84%,想要达到 RL 同等的效果,SFT 需要的参数量是 RL 的 100 到 1000 倍。作者从信息论角度给出了解释——SFT 的损失是对思维链里每一个 token 的密集监督,模型被迫去背措辞、格式、中间步骤这些大量冗余信息,26 字节的容量根本装不下;而 RL 的奖励是二元对错信号,天然过滤掉表达层面的噪声,只保留核心推理路径,信号密度高得多。

实验结果

论文还揭示了一条新的 Scaling Law:模型越大,达到同一性能阈值所需的更新参数反而越少——要让 Qwen2.5-3B 达到 95% 的峰值精度需要约 350 个参数,7B 只需约 120 个,14B 更少。这支持了"能力激活"假说:微调不是往模型里注入新知识,而是像调旋钮一样把已有能力对齐到目标模式,基座越大,“旋钮"就可以做得越小越灵敏。

行业启示:微调范式从"注入"转向"唤醒”

对做大模型微调的工程师,TinyLoRA 的启示有三层。第一,在强化学习/指令对齐(GRPO、RLHF)场景,微调预算的分配逻辑该变了——与其纠结 LoRA rank 调多大、加多少 adapter 参数,不如把精力放在奖励信号的设计上,因为 RL 场景下"改对了哪几十个参数"比"改了多少参数"更重要。第二,这印证了数据工程里"信号质量 > 数据规模"的普适原则:RL 的稀疏对错信号比 SFT 的密集 token 信号更抗过拟合、更省容量,对预算有限的领域适配尤其有价值。第三,在推理部署侧,TinyLoRA 的增量只有几十字节,几乎可以忽略存储与分发成本,为"微型补丁式"的模型热更新、多租户快速适配打开了想象空间。当然,目前结论主要建立在数学推理基准上,能否泛化到知识密集型任务仍有待验证,但"13 个参数"这个实验,已经足够让我们重新审视微调的底层逻辑。

参考文献

📄 论文原文信息

论文标题Learning to Reason in 13 Parameters
作者John X. Morris, Niloofar Mireshghallah, Mark Ibrahim, Saeed Mahloujifar
期刊arXiv (cs.LG)
发表时间2026-02-05
DOI10.48550/arXiv.2602.04118

论文原文信息地址:https://www.simolm.com/blog/2026-09-19-tinylora-13-parameters-reasoning/