论文精读 · RLVR 数据质量

噪声数据会破坏 RLVR:所谓「100% 错标也能学」为何站不住脚

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

arXiv preprint 2026.03 cs.LG 实证纠错

Yuxuan Zhu · Daniel Kang · University of Illinois Urbana-Champaign

TL;DR · 30 秒抓住结论

论文追问的不是「RLVR 能否从弱信号里激活已有能力」,而是更窄也更实用的问题:当每道题绑定的可验证答案确实是错的,现有 RLVR 还能不能抵抗这种 annotation noise?

作者发现,前作所谓「100% incorrect」训练集混入了正确答案;清除污染后,错标训练与只奖励 \boxed{} 格式相当,且在数学基准上比 clean data 低 8.5–10.0%。五种算法改进没有补回损失,BIRD Text2SQL 的真实人工错标也带来 5.7–12.1% 的下降。

16.4%
原「错误答案」集合被重验后排除;它们并非可靠的纯噪声
8.5–10.0%
100% 真错标相对 clean data 的数学准确率损失
5.7–12.1%
BIRD 原始训练标注相对人工修正版的执行准确率损失

先把问题钉死:噪声究竟落在哪个对象上?

RLVR 的 reward 不是凭空出现的。对问题 q,模型生成 rollout τ;verifier 再拿训练标注 a 判断它是否正确。于是「噪声」至少有两种完全不同的落点。

全文唯一核心问题 当标注 a 被确认是错的,而 verifier 仍按规则稳定执行时,RLVR 与它的算法改进能否避免学坏?
question q

训练问题本身。本文的 clean / incorrect / random 三组使用同一批问题。

annotation a

被当成正确答案的目标。本文主要修改和审计的就是这个对象。

reward R(τ, a)

math-verify 比较 rollout 与标注;二者匹配给 1,否则给 0。

关键边界:random reward ≠ random annotation

Random reward 是每次 rollout 独立掷硬币,属于随机 verifier 信号;random annotation 则为每道题固定一个随机答案,再由确定性 verifier 比较。前者的梯度统计性质与后者不同,不能用一个实验替另一个下结论。

旧结论为什么听起来合理,又错在了哪里?

直接对照工作 Spurious Rewards 把标准 ground-truth reward 逐步换成 majority vote、format、incorrect label 与 random reward。在 Qwen2.5-Math 上,多种弱甚至无关信号仍让 MATH-500 上升,因此提出:RLVR 可能主要是在放大预训练已有的高先验行为,而不一定从 reward 学到新推理能力。

输入 → 处理 → 输出:输入 DeepScaleR 数学题,Qwen2.5-Math 生成一组 rollouts;GRPO 分别用 ground truth、majority vote、format、incorrect label 或 Bernoulli random reward 更新模型,最后比较 MATH / AMC 表现。

有价值的发现:效果高度依赖 base model。Qwen 家族存在可放大的 code reasoning 等预训练行为,而 Llama / OLMo 上相同伪 reward 往往不工作。这说明它本来就不是「低质量数据 universally 足够」的证明。

本文补上的审计:incorrect label 由模型输出与旧 ground truth / equivalence checker 的不匹配来筛选;若 gold 不完整或 checker 太弱,正确答案就会被误收进「错误」集合。本文直接重验这个集合,而不是否定所有 spurious-reward 现象。

Spurious Rewards 比较多种 reward 在 Qwen、Llama 与 OLMo 上的训练收益
前作 Figure 1:弱与伪 reward 在部分 Qwen 模型上产生明显收益,但并不跨模型普遍成立。
  • 横向分组:Qwen2.5-Math-7B、Qwen2.5-7B、Llama3.1-8B-Instruct 与 OLMo2-7B,灰柱是 RL 前性能。
  • 奖励层级:从 ground truth、majority vote、one-shot RL 到 format、incorrect label、random reward,监督逐渐变弱。
  • Qwen 现象:错误标签与随机奖励仍带来大幅 MATH-500 增益,支持「放大已有行为」的假设。
  • 模型依赖:Llama 与 OLMo 的伪 reward 增益很小或为负,不能外推为 RLVR 的普遍鲁棒性。
  • 与本文关系:图证明了值得解释的现象,但没有证明 incorrect-label 数据真的 100% 错;后者正是本文重新核验的对象。

来源:Shao et al., 2025 ↗

因此,本文的纠正应当精确表述为:「100% incorrect annotations 仍接近 clean data」这一证据不成立,因为被比较的数据集没有满足「100% incorrect」的前提。随机 reward 是否能触发某些模型已有行为,是相邻但不同的问题。

关键工作不是新算法,而是把「真错标」做干净

作者从前作的 Qwen2.5-Math-7B 错误生成集合出发。先抽 20 条人工看,竟有 8/20 实际正确:一种原因是 ground truth 只列出一个合法答案,另一种是 equivalence checker 不认识不同写法。

先看一条为什么会被误判

旧流程只问「模型答案是否等于唯一 gold」。只要不等,就把模型答案收入 noisy set;但「不等于这一个写法」不等于「数学上错误」。

题目 求 k,使 4n² + kn + 9 为完全平方
旧记录 gold = 12 · candidate = −12 → 标成错误

GPT-5 Pro 先枚举所有合法答案

给定题目与原始 gold,annotator 不是直接判断 candidate,而是构造更完整的有效答案集合 {a₀, a₁, …}。这个例子中,12−12 都合法。

旧 ground truth {12}
补全后 {12, −12}

math-verify 处理可符号化的等价

candidate 与完整答案集合逐一比较。只要匹配任一合法答案,就从「错误」集合排除;剩余样本才进入更昂贵的 LLM judge。

比较对象 candidate = −12 ↔ {12, −12}
动作结果 match → 排除,不得用于真错标训练

GPT-5 judge 补格式语义,人审校准 judge

对符号检查未匹配的样本,GPT-5 判断语义等价;作者再独立抽 100 条人工检查,发现错误模式就改 prompt 重跑。最终样本中 judge 为 0/100 错,论文据此给出 95% 置信下错误率上界 3%。

第二类漏判 十进制 42 → 六进制 gold = (11)₆
候选写法 11 · 语义正确但旧 checker 未通过
论文的数据重验证流程:GPT-5 Pro 补全答案、符号检查、LLM Judge 与人工验证
论文 Figure 2:只有同时绕过答案补全、符号等价与语义 judge 的 candidate,才进入 truly noisy dataset。
  • Raw noisy dataset:每条记录包含问题、旧 gold 与 Qwen2.5-Math-7B 的候选答案;旧 verifier 把候选标成错。
  • GPT-5 Pro annotation:读取问题和旧 gold,补出全部可能的合法答案,处理 ground truth 不充分。
  • Symbolic equivalence:math-verify 将候选与答案集合比较;匹配则说明不是噪声,应排除。
  • LLM-as-a-Judge:处理符号工具不擅长的格式与语义等价;仍匹配则排除。
  • Manual verification:独立抽样验证 judge,发现错误后把模式反馈进 prompt;这条虚线是审计控制流,不是训练数据回流。
  • 最终输出:原集合的 16.4% 被排除,保留 12,769 道题及其经核验的错误答案。

来源:Zhu & Kang, Figure 2 ↗

从数据到参数更新:到底读了什么、改了什么?

同一组 12,769 个 q

问题集合固定,避免把题目难度误当成 annotation quality。

只替换 a

clean:正确答案
incorrect:经核验的错答案
random:每题固定随机整数

GRPO 更新模型参数

rollout 与各自的 a 比较生成 reward;胜负信号进入 advantage 与 policy update。

Train

DeepScaleR 派生的 12,769 道题;三组共享 q,只改变 annotation。

Validation

论文没有报告独立 validation split;训练时长由额外 convergence study 决定。

Evaluation

MATH-500、AIME 2024/25、AMC 2023/24;greedy decoding。AIME 2025 与 AMC 2024 晚于 base model 截止时间。

信息有没有跨 split 回流?

评测样本、rollout 或错误轨迹没有进入下一轮 GRPO;但论文用 convergence 曲线选择 600 steps / 3 epochs,因此这些 benchmark 不是严格意义上完全未触碰的 final test。读结论时应把它视为受控实证,而不是一次性 leaderboard 提交。

清掉隐藏正确信号后,曲线讲了三件事

数学实验固定 Qwen2.5-Math-7B、GRPO、batch size 64、每题 16 个 rollouts 与学习率 5×10⁻⁷。clean / incorrect / format 训练 3 epochs;random annotation 因性能崩塌在 2 epochs early stop。

Qwen2.5-Math-7B 在 clean、incorrect、format、random 与改进算法设置下的 MATH-500 训练曲线
论文 Figure 1:clean data 继续提升;100% 真错标停在 format-only 附近;随机标注最终崩塌。
  • 蓝线:clean annotation 下的 GRPO,训练后 MATH-500 约 81%,是同设置的有效上界。
  • 红线:100% 经核验的 incorrect annotation,早期略升后逐渐走低,最终比 clean 低 9 个百分点。
  • 紫线:只检查是否输出 \boxed{};与红线接近,说明错标主要强化格式,而没有扩大解题能力。
  • 灰线:每题绑定随机整数作为 annotation;错误目标稳定且无任务意义,训练后低于 base model。
  • 黄色:50% 错标下表现最好的改进算法仍只与 noisy GRPO 相近,比 clean GRPO 低约 3 个百分点。

来源:Zhu & Kang, Figure 1 ↗

1 · pass@1 不是全部

100% 错标在 MATH-500 / AIME / AMC 分别比 clean 低 9.0% / 10.0% / 8.5%。它没有重现「接近 clean」的旧结论。

2 · reasoning boundary 收缩

当 k>1,noisy model 比 base model 最多低 6.1%;更多采样也找不到原先可解的问题,说明不是只改了 greedy 输出偏好。

3 · 推理链同步变短

相对 clean,noisy 输出缩短 5.2–23.9%;噪声比例越高,准确率与长度大体单调下降。

最反直觉的诊断

训练 reward 变高并不代表能力变强。附录显示 noisy run 的平均训练 reward 反而高 149%,因为模型更容易迎合自身生成的错误先验;与此同时 entropy 更快下降、探索更早收缩。优化器成功优化了被定义的目标,但目标错了。

为什么换五种 RL 算法也救不回来?

作者在 50% 经核验错标下覆盖三类常见修补方向。被比较并保留的对象不是某个 prompt 或数据样本,而是各算法训练出的完整模型 checkpoint;最终统一在五个数学 benchmark 上评分。

Gradient bias

Dr. GRPO、TIS、PGFC 分别处理 loss bias、train–inference shift 与已知 noise rate 下的 reward correction。

Dynamic sampling

TIS、DAPO 丢掉 rollout 全对或全错的 uniform groups,保留有 advantage 差异的组。

Clipping

DAPO、SAPO 用 asymmetric / adaptive clipping 调节更新幅度与 entropy。

< 2%
没有算法能在所有 benchmark 上同时超过 50% noisy GRPO 两个百分点
3.1–7.3%
所有算法相对 clean GRPO 仍留下的准确率缺口
0 / 5
没有一种改进同时恢复 pass@k 或更长推理

这不是说 clipping 或 bias correction 没用,而是它们处理的层次不同:这些方法主要约束如何使用 reward,但 annotation noise 改写了什么答案值得奖励。尤其 PGFC 已使用真实 noise rate 作为 correction factor,仍无法稳定补回 clean gap;对 question-dependent 错标,仅知道总体噪声率并不足以知道每题的正确方向。

合成噪声之外:BIRD 的人工错标同样伤 RLVR

为避免结论只属于数学合成数据,作者从 BIRD Train 随机取 600 条 Text2SQL 样本。一个作者修正,另一位独立核验;有冲突就引入第三位,直到通过。最终 372 / 600(62%) 的 gold SQL 被修改。

BIRD-Original-600

自然语言问题、schema 与原始 gold SQL;包含真实人工标注错误。

逐条修正 + 独立复核

两位作者分工,冲突由第三位解决;得到 Corrected-600。

同模型、同 RLVR 配方

比较 Original 与 Corrected 训练;在独立修正的 BIRD Mini-Dev 上测 execution accuracy。

这里的 verifier 是什么?

模型可多轮与数据库交互。生成 SQL 与 gold SQL 的执行结果相同得 1;缺少 <solution> 标签得 −1;其他情况得 0。于是错误 gold SQL 会稳定奖励错误的执行语义。

跨五种模型,clean 训练都更好

Qwen3-235B
−10.0 pt
DeepSeek-V3.1
−6.0 pt
Qwen3-32B
−5.7 pt
GPT-OSS-120B
−10.2 pt
Llama-3.3-70B
−12.1 pt

数值为论文 Figure 9 中 GRPO(BIRD-Original-600) 相对 GRPO(BIRD-Corrected-600) 的百分点差。条形只编码损失量,不表示绝对准确率。

专为 noisy reward 设计的 PGFC 也没有稳定超过 noisy GRPO,且相对 clean baseline 仍低 5.1–16.3%。这组结果的重要性不在于某个模型掉了多少,而在于:同一批问题只修正 gold SQL,就能在五种规模与架构不同的 base model 上稳定改变 RL 结果。

这篇论文真正证明了什么,又没有证明什么?

最稳妥的结论是:当前 RLVR 不能把系统性的 annotation quality 问题当成算法细节。先把 reward target 做对,仍然比在错误 target 上优化得更聪明重要。

证明:固定错标会给出负信号

同 q、同训练配方,只替换 a 后,accuracy、pass@k 与生成长度都恶化。

证明:现有五类实例不足以兜底

bias correction、dynamic sampling 与 clipping 在 50% 错标下没有恢复 clean 性能。

未证明:所有 reward noise 都有害

随机 rollout reward、可校准 verifier error 与固定 annotation error 是不同机制;本文重点是后者。

未证明:推理变短就是因果机制

长度、entropy 与 pass@k 是一致的诊断证据,但不能单独证明模型内部为何失去能力。

范围:合成算法对比主要用 Qwen 7B

跨架构证据来自 Text2SQL;五种算法在更多 base model 上是否同样失败,仍可扩展。

证据级别:arXiv preprint

页面基于 2026.03 的 v1;尚无正式会议/期刊 venue,后续版本可能更新数字与边界。

实验复现抓手:折叠查看训练设置与公开数据文件
  • Math:Qwen2.5-Math-7B,GRPO,batch 64,group 16,学习率 5×10⁻⁷,600 steps / 3 epochs。
  • Text2SQL:GRPO / PGFC,batch 64,group 16,学习率 5×10⁻⁵,LoRA rank 32,10 epochs。
  • 公开仓库包含 noisy_data.jsondata_with_issues.jsonbird-original-600.jsonbird-corrected-600.json