#AI
Apple 论文实测 GRPO 多语言推理
Apple 联合 Hasso Plattner 研究所发表论文《GRPO Beyond English》,对 GRPO 强化学习推理训练做了一次大规模非英语实测。研究覆盖 **9 个基座模型、11 种语言、超 200 组训练实验**,内核结论是:用母语做推理训练,性能只比英语推理低 **1.1 个百分点**,远低于此前报告普遍超过 10 个百分点的差距。
论文还报告了明显的跨语言迁移:用某种语言训练往往能同时提升其他语言的推理表现。但作者也提醒,趋势高度依赖具体模型与语言,个别语言的训练甚至会严重损害其他语言的领域外能力。研究给出的判断是,GRPO 可以带来广泛的跨语言收益,但必须搭配足够宽的评估来捕捉语言特异的性能退化。
💡 为什么值得看9 个基座模型 11 种语言 200 组实验显示母语推理差距小于认知。
查证
来源档案
BAAI 智源社区链接
国内 AI 社区对 Apple 官方论文的中文摘要转引
转引自 Apple Machine Learning Research 与 arXiv 上的一手论文摘要,数据口径可信;但 BAAI 是二手转述,具体实验设计细节仍需以论文原文为准。
延伸阅读
论文指出某些语言的训练会严重损害其他语言能力,这对多语言 RLVR 落地风险最关键,值得读原文评估退化范围。
研究区分了英语推理奖励与母语推理奖励,奖励信号语言如何影响最终差距是模型对齐的实操问题。