BPCO:让大模型评论器训练更稳定、更省采样

📰 原文

原始摘要

Group-based reinforcement learning methods such as GRPO for large language models avoid training a critic by sampling multiple responses for each prompt. … We develop Best-Practice Critic Optimization (BPCO) … Across mathematical reasoning tasks … BPCO … matches or exceeds a group-based baseline while sampling one response per prompt.

论文讨论强化学习训练中的一个实际取舍:GRPO 等组相对方法以同一提示的多次采样换取优势估计;评论器(critic)可只用一次回答估计 token 级优势,却常因训练不稳定而难以使用。作者提出 BPCO,将 DPPO、受奖励范围约束的价值预测、蒙特卡洛价值目标、未归一化策略优势与长度自适应 GAE 组合成训练配方。数学推理实验覆盖 1.5B 至 30B-A3B MoE 模型,报告显示其稳定优于强评论器基线,并能以每题一次采样达到或超过组方法基线。

为什么重要

若结果可复现,训练阶段以更少生成样本取得相近效果,意味着推理/训练算力成本与吞吐瓶颈可能下降。它也把“是否使用评论器”从算法二选一,转为可通过工程化稳定性设计解决的问题。

关键要点