BPCO:让大模型评论器训练更稳定、更省采样
📰 原文
- 类别:研究
- 发布时间:2026-08-24
原始摘要
Group-based reinforcement learning methods such as GRPO for large language models avoid training a critic by sampling multiple responses for each prompt. … We develop Best-Practice Critic Optimization (BPCO) … Across mathematical reasoning tasks … BPCO … matches or exceeds a group-based baseline while sampling one response per prompt.
论文讨论强化学习训练中的一个实际取舍:GRPO 等组相对方法以同一提示的多次采样换取优势估计;评论器(critic)可只用一次回答估计 token 级优势,却常因训练不稳定而难以使用。作者提出 BPCO,将 DPPO、受奖励范围约束的价值预测、蒙特卡洛价值目标、未归一化策略优势与长度自适应 GAE 组合成训练配方。数学推理实验覆盖 1.5B 至 30B-A3B MoE 模型,报告显示其稳定优于强评论器基线,并能以每题一次采样达到或超过组方法基线。
为什么重要
若结果可复现,训练阶段以更少生成样本取得相近效果,意味着推理/训练算力成本与吞吐瓶颈可能下降。它也把“是否使用评论器”从算法二选一,转为可通过工程化稳定性设计解决的问题。
关键要点
- BPCO 专门针对 critic-based RL 的不稳定性。
- 评论器仅在训练时使用,因此可见参考答案或评分量规等策略不可见信息。
- 实验声称单回答采样即可匹配或超过组相对基线;仍需在数学推理以外任务验证。