输入 → 处理 → 输出:输入 DeepScaleR 数学题,Qwen2.5-Math 生成一组 rollouts;GRPO 分别用 ground truth、majority vote、format、incorrect label 或 Bernoulli random reward 更新模型,最后比较 MATH / AMC 表现。
有价值的发现:效果高度依赖 base model。Qwen 家族存在可放大的 code reasoning 等预训练行为,而 Llama / OLMo 上相同伪 reward 往往不工作。这说明它本来就不是「低质量数据 universally 足够」的证明。
本文补上的审计:incorrect label 由模型输出与旧 ground truth / equivalence checker 的不匹配来筛选;若 gold 不完整或 checker 太弱,正确答案就会被误收进「错误」集合。本文直接重验这个集合,而不是否定所有 spurious-reward 现象。
- 横向分组:Qwen2.5-Math-7B、Qwen2.5-7B、Llama3.1-8B-Instruct 与 OLMo2-7B,灰柱是 RL 前性能。
- 奖励层级:从 ground truth、majority vote、one-shot RL 到 format、incorrect label、random reward,监督逐渐变弱。
- Qwen 现象:错误标签与随机奖励仍带来大幅 MATH-500 增益,支持「放大已有行为」的假设。
- 模型依赖:Llama 与 OLMo 的伪 reward 增益很小或为负,不能外推为 RLVR 的普遍鲁棒性。
- 与本文关系:图证明了值得解释的现象,但没有证明 incorrect-label 数据真的 100% 错;后者正是本文重新核验的对象。