大模型微调如何摆脱反向传播的显存依赖?SubZero+ 零阶优化大学习率方法解析
零阶优化让大模型微调无需反向传播,却长期受困于梯度估计方差大、学习率极度敏感;SubZero+ 用层特定低秩子空间内的多查询梯度估计破解多查询悖论,配以子空间 Adam 与 QR 符号校正,在 Qwen2.5-32B 上全参数微调达 87.4%,较上一代 SubZero 高 2.3 个百分点,并让最优学习率窗口扩大约 100 倍、稳定范围拓宽约 3 倍。
零阶优化(Zeroth-Order, ZO)为大模型微调打开了一扇"不用反向传播"的门。2023 年,MeZO(arXiv:2305.17333)第一次证明:只用前向传播加上随机扰动来估计梯度,就能在单张消费级 GPU 上微调几十亿参数的大模型,显存占用从"存下整个计算图"骤降到"推理级"。这对资源受限的部署场景几乎是革命性的——它意味着"能不能微调"不再受限于"能不能反向传播"。但 ZO 也一直背着一个绕不开的硬伤:梯度估计方差太大,收敛不稳,对学习率极度敏感,学习率稍微调大一点,训练就可能直接崩掉。2026 年 8 月 16 日,Ziming Yu、Pan Zhou 等九位研究者在 arXiv 提交论文《SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates》(arXiv:2608.15665),用三个互补的改进,把 ZO 微调从"碰运气调参"推向"稳定可用"。
SubZero+ 首先要破解的是一个叫"多查询悖论"(multi-query paradox)的深层矛盾。直觉上,用 K 个独立随机扰动求平均,理论上能把每一步梯度估计的方差降到原来的 1/K。但在固定总前向传播预算下,用 K 个查询意味着训练步数也缩成 1/K——方差下降的好处,恰好被更新步数的减少所抵消,于是净收益归零。SubZero+ 的思路是让这 K 个查询共享同一个层特定的低秩子空间:投影矩阵 U、V 固定,各查询的梯度估计在子空间基方向上对齐,平均时"子空间内的信号分量"被增强,而"正交方向的噪声分量"相互抵消。这样一来,方差下降就转化成了真实的优化改进,而不是被步数吃掉;同时它避开了全空间多查询平均所需的 O(d) 辅助状态,保住了 ZO “推理级内存"这一核心优势。
第二个改进是子空间 Adam 优化器(subspace Adam)。传统 ZO 多用 SGD 更新,步长靠手工设定,这在高方差梯度下尤其脆弱。SubZero+ 在低秩子空间内收集多查询梯度的统计量,用 Adam 的自适应一阶/二阶矩来做更新,让每一步的步长随子空间内的梯度信号自动缩放——相当于把"该走多大步"这件事也交给数据去决定,而不是交给运气。第三个改进最隐蔽、却同样关键:用 QR 分解构造子空间投影矩阵时存在一个符号/方向歧义,同样的数学对象,不同实现可能得到符号相反的投影方向,导致训练结果对实现细节敏感。作者给 QR 构造加了一个符号校正(sign correction),保证投影矩阵服从 Haar 分布,从根上消除这种"实现依赖的方向歧义”。
实验横跨 OPT(1.3B/13B/30B)、LLaMA3.1-8B、Qwen2.5-32B 共五个尺度,在 SuperGLUE 上同时覆盖全参数微调与 LoRA 两种设置。最亮眼的是 Qwen2.5-32B 的全参数微调:SubZero+ 平均准确率达到 87.4%,比上一代 SubZero 高 2.3 个百分点、比 MeZO 高 3.8 个百分点、比 MeZO-LoRA 更是高出 10.7 个百分点。在 LLaMA3.1-8B 上,SubZero+ 把与一阶 Adam 的差距压缩到仅 0.6 个百分点(83.7% vs 84.3%),几乎追平了需要完整反向传播的一阶方法。LoRA 设置同样成立:LLaMA3.1-8B + LoRA 达到 83.4%(比 MeZO 高 2.2 个百分点),OPT-30B + LoRA 达到 72.2%(比 SubZero 高 2.8 个百分点)。
更关键的是"稳定性"这个 ZO 的老大难。在 Qwen3-0.6B 上做学习率扫描,SubZero+ 的最优学习率高达 2×10⁻²,比 MeZO 的 1×10⁻⁴ 大了约 100 倍;它在 10⁻² 到 3×10⁻² 约 3 倍宽的区间内都能保持 79% 以上的准确率,学习率增大 1.5 倍只掉 0.5 个百分点。反观 MeZO,学习率只要翻一倍,准确率就从 83.3% 暴跌到 51.7%,掉了超过 31 个百分点——一条"稍越雷池就崩"的悬崖曲线。内存上,多查询的 MeZO-Adam 在 OPT-13B 上需要 97.2GB 显存,而 SubZero+ 同配置只需 27.9GB,全参数微调场景下相对 MeZO 也仅多出约 1% 的开销(完整数据见 arXiv:2608.15665 正文表格)。
对思陌大模型微调来说,SubZero+ 的价值可以直接落到「推理部署」与「基座微调」两条业务线上。反传-free 意味着微调不再依赖完整计算图的反向传播,可以把训练从"需要大显存的训练机"下沉到"推理级资源的受限环境"——这对那些希望在自己服务器、甚至边缘设备上做领域适配微调的客户,是实打实的交付可能。而"约 100 倍的最优学习率窗口、3 倍宽的稳定平台、翻倍仅掉 0.5 个百分点"翻译成工程语言,就是调参试错成本大幅下降、训练更省人力、更不容易在交付中途翻车。思陌完全可以把它作为"低成本、反传-free 微调"这条增量方案,与既有的 LoRA、全参数路线形成互补:显存宽裕走 LoRA 或全参数,资源吃紧走 SubZero+,让"能不能微调"这件事从受限于硬件,回归到受限于需求本身。
参考文献
📄 论文原文信息
| 论文标题 | SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates |
| 作者 | Ziming Yu, Pan Zhou, Jia Li |
| 期刊 | arXiv (cs.LG) |
| 发表时间 | 2026-08-16 |
| DOI | 10.48550/arXiv.2608.15665 |
论文原文信息地址:https://www.simolm.com/blog/2026-08-23-subzero-plus-zeroth-order-fine-tuning/