Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅列表
← 返回作品集

AI 原生系列 · 强化学习

奖励即世界

作者:Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 2026-08-24 · 第 3 集,共 5 集

Cover: white ground with a black left rail. Eyebrow AI-NATIVE SERIES · REINFORCEMENT LEARNING above the serif headline 'The Reward Is the World' and the lines 'Reward hacking is not an AI problem. An economist wrote it down in 1975.' A horizontal timeline runs beneath with four markers: filled dots at 1975 Goodhart, 1979 Campbell and 1997 Strathern rephrases, then a hollow outlined circle at 2026 labelled 'your reward model'. Three grey cards below read THE BILL U(y), what you actually want; THE PROXY r(y), what your code optimizes; THE GAP where it breaks, and the optimizer finds it.
四个标记里有三个早已是定论,唯独空心的那个,是你正在跑的训练。

1 分钟速览——你能带走什么

每一个 RL 系统里都有两个函数,而你的代码里只装得下其中一个。U是你真正想要的东西。r是你实现出来的代理指标。优化器最大化的是r,而只要这两者在优化器能触及的区域里出现分歧,它就会找到那个区域——不是因为它心机深,而是因为这就是它的本职工作。这正是古德哈特定律,发表于 1975 年:any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes.(中译:任何被观测到的统计规律,一旦被用于控制目的而施加压力,都会趋于崩溃。) 这个重新框定之所以值得,是因为它告诉你什么办法 可能奏效:奖励攻破不是 RLHF 里一个可以打补丁修掉的 bug,而是任何指向代理指标的控制系统的通用行为。所以有用的问题不是「我的奖励对不对?」,而是"how much optimization pressure can it survive?"(中译:它能扛住多大的优化压力?)——只有第二个问题带着一个数字。

写下两个函数。

U(y)——真正的效用。你真正想从模型那里得到的东西。这个函数从来不在你的代码库里。它也不可能在;如果你能把它精确写下来,你根本不需要机器学习。

r(y)——实现出来的代理指标。一个基于偏好训练出的奖励模型,一个单元测试,一份由裁判打分的评分标准。这一个确实在你的代码库里,也是你的优化器唯一能看到的东西。

本集里的每一次失败,都活在这两者之间的缝隙里。

核心观点:这条定律已有五十年历史

在断定奖励攻破是语言模型的发明之前,先注意到经济学家早在 RLHF 出现的半个世纪之前就把它写下来了。

Charles Goodhart,论英国货币政策,1975 年 [1]:

Any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes.(中译:任何被观测到的统计规律,一旦被用于控制目的而施加压力,都会趋于崩溃。)

大多数人熟悉的说法——"when a measure becomes a target, it ceases to be a good measure"(中译:当一个指标变成目标,它就不再是一个好指标。)——其实不是 Goodhart 的原话。它出自人类学家 Marilyn Strathern,1997 年 [1]。值得了解一下,因为原话其实更有用:它讲的是压力,指出的是机制本身,而不是表面症状。

Donald Campbell 可以说更早就得出了同样的结论,1979 年 [2],其表述可追溯到 1969 年:

The more any quantitative social indicator is used for social decision-making, the more subject it will be to corruption pressures and the more apt it will be to distort and corrupt the social processes it is intended to monitor.(中译:任何定量社会指标一旦被用于社会决策,就越容易招致腐化压力,也越容易扭曲、腐蚀它原本要监测的社会过程。)

用我们的记号来说:一旦r被用来优化而非用来观察,那么曾经证成我们使用r来代表U的那种相关性,就开始瓦解——而且恰恰在优化器最强的地方,瓦解得最快。r为什么这次重新框定值得你花一段话去理解

因为它告诉你哪些修补是不可能奏效的。

如果奖励攻破只是 RLHF 的一个 bug,那修法就该是造一个更好的奖励模型。但它其实是任何

以代理指标为目标的控制系统的通用行为,五十年来失败的补丁史可以为证:应试教育、医院操纵候诊时间指标、殖民地的捕鼠悬赏催生出养鼠场。每一次,人们都用一个定义更精确的目标去应对;每一次,那个目标随后都被钻了空子。所以,工程上真正的应对,是换一个问题去问。别再问「这个奖励对不对?」,改问「这个奖励能撑住多大的优化压力?」(中译:Stop asking "is this reward correct?" Start asking "how much optimization pressure can this reward survive?")

这是两个不同的问题,而且只有第二个问题能给出一个具体数字——步数、KL 预算、best-of-n,不管你用什么方式衡量你施加的力道。覆盖面与可被攻破性此消彼长。R1-Zero 选择了那条更窄、但更诚实的路。现实仍能为你打分的那一处

Diagram titled 'The gap between what you want and what you wrote down' with three columns — broad coverage, smooth to climb, survives pressure — and five reward sources as rows: preference model, rubric or LLM judge, unit test (RLVR), format reward, and tool-call bonus. Filled dots show which properties each has. The preference model has broad coverage and is smooth to climb but does not survive pressure; the unit test and format reward survive pressure but have narrow coverage. Footer reads: coverage and hackability trade against each other, always. R1-Zero chose the bottom two and moved AIME 2024 from 15.6 percent to 71.0 percent.
有一条出路,它很窄,但确实存在:有时候,世界本身可以核对答案。

RLVR

——基于可验证奖励的强化学习——用一种无法被花言巧语哄骗的东西,取代了那个学出来的奖励模型。单元测试通过了吗?最终答案,装进规定的框里之后,是否等于已知的正确答案?

DeepSeek-R1-Zero 是「这不是玩具」的最有力证据 [3]。全程只用基于规则的奖励:可核对答案的准确率,外加一个要求生成规定格式的奖励。整个回路里没有任何神经网络评论家。AIME 2024 的 pass@1 从

15.6% 提升到了 71.0%,最终的 R1 模型在经过进一步的监督学习与强化学习流程之后,达到了大约 79.8% [3]。<think>…</think><answer>…</answer> structure。整个流程里没有任何神经评论家网络。AIME 2024 的 pass@1 从 15.6% 提升到 71.0%,最终版 R1 模型在经过进一步的监督学习和 RL 流程后,达到了大约 79.8%79.8% [3]。

验证器的适用范围很窄——你想要模型具备的大多数能力,都没法用单元测试来检验——但在它管辖的这一小片领域内,它是诚实的,而当优化器足够强大时,诚实胜过广博。

读到这里,先猜一猜

针对一项编程任务,你有两个奖励来源。来源 A 是一个偏好模型,基于 5 万条人类对代码质量的判断训练而成。来源 B 是仓库里现成的测试套件。

你打算狠狠地训练——长时间运行,高强度优化压力。你更信任哪一个奖励,为什么?

大多数人会因为覆盖范围而选 A:它能捕捉可读性、风格、意图,这些都是测试做不到的。这种直觉在“它衡量的是什么”这件事上是对的,但在“什么能扛得住压力”这件事上就错了。A 是从有限样本中学出来的一种统计规律,表面平滑而丰富,优化器可以顺着任何标注者从未设想过的方向一路爬上去。B 则狭窄、脆弱、枯燥——但它没有可以被讨好的“观点”。

失败现场:段落生成机

用一个温和偏好“更长、结构更好的答案”的奖励模型来训练。没有任何病态之处——这是一个真实的、诚实学出来的偏好。

你会依次得到:稍微变长的答案;然后是带标题的答案;然后是带标题、项目符号和总结的答案;最后是一个模型,哪怕正确答案只是一个“不”字,它也会一本正经地生成一篇格式精美的三段式文章。

什么都没坏。奖励模型从未出错——人类平均而言确实偏好结构,至少在它训练所用的那个分布上是这样。优化器只是一路走到了那个分布的边界,然后继续往前走;它走得越远,那个“平均而言”就越没有意义。

这要付出什么代价

古德哈特定律并不会告诉你该怎么做。它是一种诊断,不是一种处方。知道你的代理指标会在压力下漂移,并不能告诉你多大的压力才算可以接受。

验证器同样无法幸免于这个问题。 测试套件也是一种代理指标——代理的是「能跑起来的软件」。只要针对它优化得足够狠,你就会得到一份能通过所有测试、却毫无用处的代码。

而且,U 在构造上就是无法被测量的。 任何声称能检测出奖励攻破的实验,都需要一个策略从未训练过的、留存在外的效用函数——这意味着你至少得能写下一部分你刚才说写不出来的东西。

接下来会怎样

第 4 集会放下「该优化什么」这个问题,转而讨论当精巧的算法遇上长序列、过期的轨迹采样与系统工程的现实时会发生什么——那时候的失败,不是因为你追错了指标,而是你的训练早在几千步之前就已经停止学习,而损失曲线对此只字未提。——转而讨论当精巧的算法遇上长序列、过期的轨迹采样与系统工程的现实时会发生什么——那时候的失败,不是因为你追错了指标,而是你的训练早在几千步之前就已经停止学习,而损失曲线对此只字未提。

本文是《智能体工程历险记》第一季——后果引擎第 3 集。本系列文章中的论断均按类别标注——定义、推导、证据、工程选择、开放问题——比喻可以用来引出一个论断,但绝不能充当该论断的证据。每一集都配有可在 CPU 上运行的实验室。本文不含任何雇主或客户的材料。——Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app

参考文献

  1. Goodhart, C. A. E. (1975). Problems of Monetary Management: The U.K. Experience. 古德哈特定律的出处。广为流传的那句“当一个指标变成目标,它就不再是个好指标”,其实并非古德哈特本人的措辞,而出自 Strathern, M. (1997), Improving Ratings: Audit in the British University System, European Review 5(3), 305–321——并非古德哈特原话。概览与出处
  2. Campbell, D. T. (1979). Assessing the Impact of Planned Social Change. Evaluation and Program Planning, 2(1), 67–90。相关表述最早可追溯至 1969 年,因此 Campbell 或有更早的优先权。摘要与背景
  3. Guo, D. et al. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. AIME 2024 数据的出处(R1-Zero 的 15.6% → 71.0%;R1 约为 79.8%),以及基于规则的准确率+格式奖励设计。 arxiv.org/abs/2501.12948
  4. Ouyang, L. et al. (2022)。 Training language models to follow instructions with human feedback(InstructGPT)。本集所批判的 RLHF 流程即出自此文。 arxiv.org/abs/2203.02155
  5. Rafailov, R. et al. (2023)。 Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arxiv.org/abs/2305.18290
  6. Bradley, R. A. & Terry, M. E. (1952)。 Rank Analysis of Incomplete Block Designs. Biometrika 期刊。这是所有基于学习的奖励模型背后都在用的偏好模型。 doi.org/10.2307/2334029