GRPO+RLVR模型在数学推理任务上实现3.7倍准确率提升

2026.05.08 07:10
本文介绍结合GRPO与RLVR的模型训练方法,用于数学推理任务。该方法采用双奖励系统,无需人工标注即可提供客观反馈。在GSM8K数据集上,训练后的Qwen2.5-0.5B模型准确率达41%,较基础模型提升3.7倍,且可扩展至代码生成等领域。

传统强化学习训练大语言模型时,容易出现“奖励黑客”问题——模型会通过非预期的方式最大化奖励,却没有真正达成目标。为此,研究人员尝试将GRPO(组相对策略优化)与RLVR(可验证奖励强化学习)结合,利用可验证的奖励信号指导训练,整个过程无需人工标注。

这套方法设计了双奖励机制:一方面,格式奖励函数会检查输出是否符合特定结构(如“#### The final answer is [number]”),符合则给予0.5分;另一方面,正确性奖励函数会提取数值答案并与真实结果对比,正确则加1.0分,两项全对最高可得1.5分。

训练过程以Qwen2.5-0.5B模型为基础,借助QLoRA技术降低资源消耗,并在Amazon SageMaker平台上开展分布式训练;同时,团队采用8-shot提示方式,引导模型生成符合要求的输出。

在GSM8K数据集上的实验结果表明,经GRPO训练后的模型准确率达到41%,相比基础模型的11%提升了3.7倍。其中8-shot提示的效果最佳,0-shot和2-shot表现则相对逊色——这说明模型需要一定数量的示例来激活其推理能力。

这套方法还能扩展到代码生成(通过执行结果验证正确性)、医疗文本生成(通过关键词语义匹配验证)等场景,应用潜力较为广泛。

作品声明:内容由AI生成

快报

更多

17:44

商务部初步认定原产于墨西哥和美国的进口碧根果存在倾销

17:43

伊朗外交部:美国海上封锁阻碍霍尔木兹海峡恢复通航

17:40

曙光股份:前7月整车销量541辆,同比下降32.04%

17:40

南向资金今日净买入20.21亿港元,Minimax获净买入居前

17:37

摩根大通:全球存储芯片短缺或持续至2028年,HBM明年平均售价增幅或超四成

17:37

市场监管总局批准发布一批重要国家标准

17:34

抖音治理蹭用村干部等身份营销带货乱象

17:34

天津市拟于8月11日上午启动防汛二级应急响应

17:33

美银:7月CPI重要性高于就业报告,仍预计美联储9月启动加息

17:31

宇通客车:上半年归母净利润18.67亿元,同比下降3.52%

17:25

德银Q2增持美光科技,英伟达位列第一重仓股

17:21

2连板先导基电:主营业务不包括磷化铟衬底,亦无磷化铟衬底相关业务收入及利润

17:18

央行授权德意志银行股份有限公司担任法兰克福人民币清算行

17:18

富维股份:获合资品牌客户座椅项目定点,预计总销售金额39.36亿元

17:16

五一视界半年报超预期,物理AI核心收入同比增长545%

17:14

上交所终止阳光集团发行上市审核

17:12

钶锐锶科创板IPO定于8月17日上会

17:10

受贿6798万余元,中国一重原副总经理陆文俊一审获刑15年

17:09

上海:支持企业研发的创新药、现代中药和高端医疗器械全球注册认证并在当地实现销售

17:08

上海:支持集成电路企业实现全产业链突破,培育一批具有国际竞争力的领军企业