工具调用智能体该选 SFT 还是 RL 微调?六档 Qwen3 受控实验对比解读
EMNLP 2026 REALM Workshop 论文:在六档 Qwen3(0.6B–32B)上系统对比 SFT+LoRA 与 GRPO,SFT 在分布内 15/18 场景最强,跨数据集迁移 GRPO 29/54 场景占优但平均领先不足 1 分,数据混合对迁移的提升稳定且与方法无关。
工具调用(Tool-Calling)已经成为大模型智能体落地的核心能力——让模型在推理时按需调用外部 API、检索器或代码执行器,而不是把知识全塞进参数里。但在训练环节,究竟该用监督微调(Supervised Fine-Tuning,SFT)还是强化学习(Reinforcement Learning,RL)来增强这一能力,业界长期缺乏受控的量化证据。近日,Md Tahmid Rahman Laskar、Xue-Yong Fu 与 Shashi Bhushan TN 发表论文《SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale》,已被 EMNLP 2026 的 REALM Workshop 接收,用一组严格受控的实验首次系统地回答了这个问题。
核心方法:把数据、方法、规模三个变量分开看
作者在三档维度上做了交叉实验,从而能分离出「方法」本身的贡献,而不是被数据质量或规模差异混淆。具体来说,适配方法上对比了三条路线:SFT + 低秩自适应(LoRA)参数高效微调、基于组相对策略优化(Group Relative Policy Optimization,GRPO)的强化学习、以及「先 SFT 冷启动再 GRPO」的 SFT→GRPO 两步走。模型规模上覆盖 Qwen3 的六个档位,从 0.6B 一路到 32B。评测场景则拆成分布内(训练与测试数据同源)与跨数据集迁移(训练与测试数据不同)两类。
GRPO 是近年推理模型(如 DeepSeek-R1)广泛采用的免批评家(critic-free)强化学习算法,它通过组内相对比较来构造优势信号,省去了价值网络。将它与最朴素的 SFT 放在同一张桌子下比较,正是这篇论文最大的价值所在。
实验数据:分布内 SFT 赢,跨迁移 GRPO 仅微弱占优
分布内的结论相当干脆——SFT+LoRA 是 0.6B 到 32B 全尺度范围内最强的分布内方法,在 18 个实验设置中拿下 15 个最佳。这意味着当训练数据与测试数据同源时,直接监督微调在工具调用任务上比强化学习更稳定、也更高效。
跨数据集迁移的图景则更微妙,作者统计了训练与测试数据集不同的 54 个设置:
| 对比维度 | SFT+LoRA | GRPO | SFT→GRPO |
|---|---|---|---|
| 分布内最佳设置数 | 15/18 | — | — |
| 跨数据集迁移最佳设置数 | — | 29/54 | 极少 |
| 迁移场景相对 SFT 平均领先 | 基准 | 不足 1 分 | — |
几个关键发现值得单独拎出来:
- SFT+LoRA 在分布内 18 个设置中 15 个最佳,且这一优势在整个 0.6B–32B 范围内一致成立。
- GRPO 在跨数据集迁移的 54 个设置中 29 个占优,但相对 SFT 的平均领先不足 1 个点,优势相当有限。
- 「SFT→GRPO」两步走在任何一类比较中都很少是最强的,叠加强化学习并未带来预期中的增益。
- 数据混合(Dataset Mixing)能稳定提升迁移能力,同时保持接近专用的分布内表现,而且这一效果与训练方法无关。
- 额外分析证实 LoRA 优于全参数微调(Full Fine-Tuning),因为 LoRA 能更好地保留预训练阶段已经习得的智能体行为。
行业启示:先看数据分布,再选训练方法
对做大模型微调的工程师来说,这项研究的启示是「按场景选方法」,而不是无脑追逐最新的强化学习范式。第一,在数据同源、追求分布内准确率的场景,SFT+LoRA 仍是性价比最高的首选,不必为工具调用专门上 GRPO;第二,当评测集与训练集分布偏移较大时,与其堆强化学习,不如优先做多数据集混合——它对迁移能力的提升稳定、且几乎不带来额外训练成本;第三,LoRA 优于全参数微调这一结论再次印证了参数高效微调在「保留预训练能力」上的优势,这对需要保留通用智能体行为的基座微调与指令对齐尤其关键。整体来看,工具调用微调的优化重点,正从「选哪个算法」逐渐转向「怎么配数据、怎么控规模」这条更工程化的主线。
参考文献
- arXiv: 2609.17848 — SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale
- DOI: 10.48550/arXiv.2609.17848
📄 论文原文信息
| 论文标题 | SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale |
| 作者 | Md Tahmid Rahman Laskar, Xue-Yong Fu, Shashi Bhushan TN |
| 期刊 | EMNLP 2026 REALM Workshop |
| 发表时间 | 2026-09-15 |
| DOI | 10.48550/arXiv.2609.17848 |
论文原文信息地址:https://www.simolm.com/blog/2026-09-18-sft-vs-rl-tool-calling-agents/