低资源语言大模型如何学会用母语思考?SFT 打底 + 可验证奖励 RL 修补的双阶段微调方法
研究者用三大前沿 MoE 模型(Alibaba/OpenAI/NVIDIA)微调其用希腊语推理,发现准确率基准几乎纹丝不动,换随机种子就能波动 7.7 分;真正变化藏在准确率看不到的地方——SFT 让 98% 的回答改用问题语言思考且通用能力零退化,RL 则把格式回退从 24% 压到 2.5%、答案泄漏从 3.5% 清零。
一个看似简单的问题正在困扰多语言大模型:当用户用低资源语言提问时,模型到底"用哪种语言在思考"?如果它心里默念的是英语、嘴上才切换成希腊语或乌尔都语,那么母语用户既读不懂它的推理过程,也谈不上审计、纠错——这层"思考黑箱"直接切断了用户与模型的可信连接。2026 年 8 月 18 日,研究者 Ayoub Kirouane 与 Christos Petrocheilos 在 arXiv 提交论文《Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See》(arXiv:2608.17744),他们拿了三款前沿混合专家(MoE)模型(分别来自 Alibaba、OpenAI、NVIDIA,激活参数约 3.6–4.0B),专门微调它们用希腊语——一个低资源语言——去推理,然后把"准确率"这个被惯坏的度量放在一边,转而去测那些准确率根本看不见的行为。
论文的第一个结论是个漂亮的"零结果":在准确率基准上,这些微调几乎什么都没发生,甚至这个基准本身在如此规模下就是噪声——只换一个随机种子,分数就能漂移 7.7 分,比他们测到的所有数据配方和训练配方效应都大。真正剧烈的变化藏在准确率照不到的地方。基础模型从来不用希腊语思考:在 1,000 条推理轨迹里,哪怕问题本身是希腊语,也没有一条是用希腊语在内部推理的——模型答案是对的,可它的推理过程用户读不了、审不了、改不了。经过监督微调(SFT)后,每一个发布的 checkpoint 都开始用问题语言思考了,覆盖约 98% 的样本,其中一个模型族甚至用少 3 倍的 token 就完成了推理;四款模型的语法性(grammaticality)全部提升,通用能力则保持在各自基座几个点以内——什么都没遗忘,而流利度被补上了。
但 SFT 也有它修不好的自身缺陷。研究者发现:约四分之一(24%)的回答会跳过要求它采用的格式(fallback),答案内容会泄漏进推理通道(leak,占 3.5%),而一条显式的"请用英语思考"指令,遵守率不到一半。这时候强化学习登场——用可验证奖励(verifiable rewards)训练、且在训练前就做了预注册(pre-registered)的 RL,把前两个缺陷直接修干净:格式回退从 24% 掉到 2.5%,答案泄漏从 3.5% 归零(两者都对照一个平坦随机奖励的对照实验),第三个"用英语思考"指令的遵守率也提升了 9.1 个百分点。更耐人寻味的是,那个"用希腊语思考"的习惯在只追准确率的梯度下原封不动地存活——也就是说,如果你想靠刷准确率来逼模型改变它的思考语言,是逼不动的。
这套实验最有价值的地方,其实在于它的"测量纪律"。作者没有满足于报告一个分数,而是提出了六个行为维度(behavioural dimensions)来把这类变化变成可测的量,并且每一个维度都设置了一道闸门:凡是与输出长度相关的指标一律拒收,防止"答案更长"冒充"想得更像母语"。他们还坦率地记录了自己仪器的六次"说谎",每一次都被一个对照实验抓出来。整条链路——仪器、对照、预注册——可以原样迁移到任何低资源语言,希腊语只是那个恰好能被他们量出来的案例。团队最终开源了五个 checkpoint,供社区复现与继续验证。
对思陌大模型微调而言,这篇论文几乎同时点中了「领域适配训练」「指令微调与对齐」和「评估优化」三条业务线。其一,它把"SFT 负责补能力、RL 负责纠行为"的分工讲得很透:企业客户做小语种、方言或垂直领域本地化时,SFT 能换来流利和零遗忘,但格式遵守、指令跟随这类"可校验"的硬指标,还得靠带可验证奖励的 RL 来兜底——这正是思陌在给客户规划微调方案时可以直接复用的分层思路。其二,“准确率看不见的行为"提醒我们,交付前只跑几个 benchmark 分数是危险的,应当像论文那样给客户补一层行为维度的评测(是否用目标语言思考、是否遵守格式、是否泄漏答案),这正是「模型评估优化」能做出差异化的地方。其三,作者强调的"低资源语言几乎无法从海量互联网语料中自然涌现”,恰恰是「数据工程服务」的用武之地——如何用有限的低资源语料做数据合成与清洗,把母语思考能力"补"进模型,是思陌面向出海与小语种客户时一张有说服力的牌。
参考文献
📄 论文原文信息
| 论文标题 | Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See |
| 作者 | Ayoub Kirouane, Christos Petrocheilos |
| 期刊 | arXiv (cs.CL) |
| 发表时间 | 2026-08-18 |
| DOI | 10.48550/arXiv.2608.17744 |
论文原文信息地址:https://www.simolm.com/blog/2026-08-20-sft-rl-low-resource-language-thinking/