← 行业趋势
工具调用智能体该选 SFT 还是 RL 微调?六档 Qwen3 受控实验对比解读

工具调用智能体该选 SFT 还是 RL 微调?六档 Qwen3 受控实验对比解读

EMNLP 2026 REALM Workshop 论文:在六档 Qwen3(0.6B–32B)上系统对比 SFT+LoRA 与 GRPO,SFT 在分布内 15/18 场景最强,跨数据集迁移 GRPO 29/54 场景占优但平均领先不足 1 分,数据混合对迁移的提升稳定且与方法无关。

封面

工具调用(Tool-Calling)已经成为大模型智能体落地的核心能力——让模型在推理时按需调用外部 API、检索器或代码执行器,而不是把知识全塞进参数里。但在训练环节,究竟该用监督微调(Supervised Fine-Tuning,SFT)还是强化学习(Reinforcement Learning,RL)来增强这一能力,业界长期缺乏受控的量化证据。近日,Md Tahmid Rahman Laskar、Xue-Yong Fu 与 Shashi Bhushan TN 发表论文《SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale》,已被 EMNLP 2026 的 REALM Workshop 接收,用一组严格受控的实验首次系统地回答了这个问题。

核心方法:把数据、方法、规模三个变量分开看

作者在三档维度上做了交叉实验,从而能分离出「方法」本身的贡献,而不是被数据质量或规模差异混淆。具体来说,适配方法上对比了三条路线:SFT + 低秩自适应(LoRA)参数高效微调、基于组相对策略优化(Group Relative Policy Optimization,GRPO)的强化学习、以及「先 SFT 冷启动再 GRPO」的 SFT→GRPO 两步走。模型规模上覆盖 Qwen3 的六个档位,从 0.6B 一路到 32B。评测场景则拆成分布内(训练与测试数据同源)与跨数据集迁移(训练与测试数据不同)两类。

GRPO 是近年推理模型(如 DeepSeek-R1)广泛采用的免批评家(critic-free)强化学习算法,它通过组内相对比较来构造优势信号,省去了价值网络。将它与最朴素的 SFT 放在同一张桌子下比较,正是这篇论文最大的价值所在。

技术原理

实验数据:分布内 SFT 赢,跨迁移 GRPO 仅微弱占优

分布内的结论相当干脆——SFT+LoRA 是 0.6B 到 32B 全尺度范围内最强的分布内方法,在 18 个实验设置中拿下 15 个最佳。这意味着当训练数据与测试数据同源时,直接监督微调在工具调用任务上比强化学习更稳定、也更高效。

跨数据集迁移的图景则更微妙,作者统计了训练与测试数据集不同的 54 个设置:

对比维度 SFT+LoRA GRPO SFT→GRPO
分布内最佳设置数 15/18
跨数据集迁移最佳设置数 29/54 极少
迁移场景相对 SFT 平均领先 基准 不足 1 分

几个关键发现值得单独拎出来:

  • SFT+LoRA 在分布内 18 个设置中 15 个最佳,且这一优势在整个 0.6B–32B 范围内一致成立。
  • GRPO 在跨数据集迁移的 54 个设置中 29 个占优,但相对 SFT 的平均领先不足 1 个点,优势相当有限。
  • 「SFT→GRPO」两步走在任何一类比较中都很少是最强的,叠加强化学习并未带来预期中的增益。
  • 数据混合(Dataset Mixing)能稳定提升迁移能力,同时保持接近专用的分布内表现,而且这一效果与训练方法无关。
  • 额外分析证实 LoRA 优于全参数微调(Full Fine-Tuning),因为 LoRA 能更好地保留预训练阶段已经习得的智能体行为。

实验结果

行业启示:先看数据分布,再选训练方法

对做大模型微调的工程师来说,这项研究的启示是「按场景选方法」,而不是无脑追逐最新的强化学习范式。第一,在数据同源、追求分布内准确率的场景,SFT+LoRA 仍是性价比最高的首选,不必为工具调用专门上 GRPO;第二,当评测集与训练集分布偏移较大时,与其堆强化学习,不如优先做多数据集混合——它对迁移能力的提升稳定、且几乎不带来额外训练成本;第三,LoRA 优于全参数微调这一结论再次印证了参数高效微调在「保留预训练能力」上的优势,这对需要保留通用智能体行为的基座微调与指令对齐尤其关键。整体来看,工具调用微调的优化重点,正从「选哪个算法」逐渐转向「怎么配数据、怎么控规模」这条更工程化的主线。

参考文献

📄 论文原文信息

论文标题SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale
作者Md Tahmid Rahman Laskar, Xue-Yong Fu, Shashi Bhushan TN
期刊EMNLP 2026 REALM Workshop
发表时间2026-09-15
DOI10.48550/arXiv.2609.17848

论文原文信息地址:https://www.simolm.com/blog/2026-09-18-sft-vs-rl-tool-calling-agents/