Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅列表
← 返回作品集

AI 原生系列 · 强化学习

后果引擎

作者 Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 2026-08-24 · 第 1 集,共 5 集

Cover: white background with a black rail down the left edge. The label 'AI-NATIVE SERIES · REINFORCEMENT LEARNING' sits above a serif headline, 'The Consequence Engine', and the line 'Every RL acronym you have ever been afraid of changes one or two boxes of the same seven-box loop.' Below, seven connected boxes read TASK, POLICY, ROLLOUT, REWARD, CREDIT (filled black), UPDATE, EVAL, with a dashed line closing the loop back to TASK. Three grey cards at the bottom read: GRPO CHANGES Credit — siblings replace the critic; DAPO CHANGES Rollout + Update — 50 AIME vs 47, half the steps; R1-ZERO CHANGED Reward only — 15.6 percent to 71.0 percent on AIME 2024.
这个循环就是整个学科本身,缩写只是对它做的修改。

一分钟速览——读完你能带走什么

面向语言模型的强化学习看起来像个动物园:REINFORCE、RLOO、PPO、GRPO、DAPO、Dr.GRPO、GSPO、CISPO、RLVR。读起来像九门学科,但其实是一个七格的循环——任务、策略、轨迹采样、奖励、功过分配、更新、评估——几乎每一个缩写改动的都只是一两个格子,而非整体。把它们排开来看,七个格子里,有五个都在争论同一个词:某个行为到底该记多少功过。这不是为初学者做的简化,而是一张地图——出问题时,它告诉你该去读哪篇论文。这事有多重要,看这个证据就知道:DeepSeek-R1-Zero 把 AIME 2024 的成绩从15.6% 提到了 71.0%,靠的是改动奖励这一格和功过分配这一格,没有监督微调,也没有学出来的评论家网络。同样的七个格子,两处改动。

语言模型强化学习这个话题,读着读着就会读出一种特殊的疲惫感。

一开始学的是 PPO。接着有人说 PPO 过时了,现在是 GRPO。然后 GRPO 有偏差,于是变成 Dr.GRPO。然后 GRPO 在大规模训练时崩了,于是有了 DAPO。然后是 GSPO,因为比率的粒度不对。然后是 CISPO,因为裁剪把有意思的 token 都删掉了。然后是 TIS,因为训练引擎和推理引擎给出的概率对不上。

数到第九个缩写时,内心真实的独白是:am I supposed to have read nine papers to understand one idea?(中译:为了搞懂一个想法,我真的要读九篇论文吗?)

不需要。你需要的只是一张图。

一个核心想法:七个格子,人人都只改其中两个

预训练和监督微调其实是在用两种不同的口音问模型同一个问题:你能不能预测或者模仿出想要的输出?

强化学习问的是完全不同的问题:

你能不能行动、观察后果,并改变自己未来行为的概率,让有用的结果变得更可能发生?

这一句话就是整个学科的全部内容,它以一个七格循环的方式运转。任务——模型身处什么情境。策略——它给各种可能的行动分配了怎样的概率。轨迹采样——采样时它实际做了什么。奖励——这个后果有多好。功过分配功过 中,哪一项行为该受表扬或该受责怪。 更新 ——修改参数。 评估 ——这一变化是真的泛化了,还是只是讨好了记分板。

有用的部分来了。把这九个缩写拿出来,逐一追问:它动了哪一格?

Infographic titled 'Which box does each acronym actually change?'. Across the top: the seven boxes TASK, POLICY, ROLLOUT, REWARD, CREDIT, UPDATE, EVAL. Seven rows below, each an algorithm with a one-line gloss and a filled dot under the box or boxes it modifies. REINFORCE, the honest baseline — dot under CREDIT. RLOO, siblings as baseline — CREDIT. PPO, a speed limiter — CREDIT and UPDATE. GRPO, fire the critic — CREDIT. DAPO, keep exploring — ROLLOUT and UPDATE. Dr.GRPO, fix the denominator — CREDIT. RLVR slash R1-Zero, let reality grade it — REWARD. A footer card reads: Seven algorithms. Nobody touches TASK, POLICY or EVAL. Five of the seven argue about CREDIT — which is to say: about one term in one equation.
没人动任务、策略或评估。

七格里有五格落在同一格上。它们不是九个不同的主题,而是围绕同一个问题的一场漫长争论——这个结果,是否好过我们本该预期的水平? ——不断有人找到新方法,让上一个答案露出破绽。

记住这一点,你就能免于陷入一种我只能称之为“缩写焦虑症”的精神内耗。

这套循环不是教学简化

有人可能会怀疑,这七格不过是为了写这类文章而发明的友好示意图,真实系统要混乱得多。下面这个反例,改变了我的看法。

DeepSeek-R1-Zero 拿一个基础模型做实验,把它在 AIME 2024 上的 pass@1 分数从 15.6% 提升到了 71.0% [1]。在一个数学竞赛基准上,差不多翻了四倍。最终版的 R1 模型,在经过进一步的监督训练和 RL 流程后,能达到大约 79.8% [1]。

他们改了什么?不是架构,也不是预训练。他们改的是 奖励这一格 ——用基于规则的信号取代了一个学出来的神经网络评论家:最终答案是否落在规定的框里、是否正确,输出是否符合要求的<think>…</think><answer>…</answer>格式 [1]。他们还改了功过分配这一格,用的是 GRPO——它抛弃了学习出来的价值模型,转而用一组兄弟轨迹采样来计算基线。[2]

两个格子,四倍提升。这个循环是承重结构。

再往下一层看机制:RL 干的事,是搬运概率质量

有一件事,我花了很久才想通,说出来有点不好意思——但一旦想通,后面每个缩写就都不难懂了。

策略梯度更新并不会教会模型某个事实,它只是在重新分配概率质量。当一次轨迹采样表现不错时,更新会提高生成那段 token 序列的概率——而因为所有概率加起来必须等于一,其余所有可能性就会被压低一点点。它能做的,仅此而已。

这一点立刻暴露了危险所在。假设模型十次尝试里只对了一次,你却拿这唯一一次成功去训练——它究竟是学会了推理过程,还是纯属侥幸,而你现在反而把这条侥幸的路径变得更容易发生了?

单看结果,你根本分不清是哪一种。同样的奖励,可能对应两种截然不同的学习事件,而奖励信号本身却完全区分不出来。这正是那张图里整个「功过分配」一栏存在的理由——而第一个补救办法,是一个听起来平平无奇的问题:

这个结果,是否好过我们本来应该预期的水平?

把预期值减掉,你就不会再奖励运气了。这个减法,就是基线。用另一个模型去学这个预期值,你就得到了评论家网络。改成从同一组轨迹采样中直接算出来,你就得到了 GRPO。再为了怎么归一化吵一架,你就得到了 Dr.GRPO。从头到尾,争论的都是同一个词。

先猜,再往下看

在读下一节之前,先给出一个答案——预测这件事的意义,就在于它可能是错的。

你的模型在十次数学解题尝试里蒙对了一次,你就拿这唯一一条成功轨迹做微调。接下来发生的是:(a) 它学会了推理算法,(b) 它记住了一条很窄的轨迹,还是 (c) 它只是在恰好管用的那片区域附近提高了概率?

严谨一点的答案是:单看结果,你根本判断不出来,任何声称能判断出来的说法,说的其实是你的评估方式出了问题,而不是你的模型有什么本事。要把这三种假设区分开,需要用到 pass@k、专门设计的探索度量,以及分布外的留出评测。如果你的评估只报一个准确率数字,这三种情况看起来会一模一样。

代价是什么,说句实话

七格地图是一种压缩,而压缩必然会丢东西。有三点很要紧。

它抹平了真实存在的数学差异。 PPO 的裁剪代理目标和 GRPO 的组相对优势值,并不能因为都归在「功过分配」这一格,就被当成可以互相替换的东西。这张地图能告诉你该往哪儿看,却告诉不了你具体的推导过程。

有两格是故意没画出来的。 真实系统里存在训练引擎和推理引擎,二者可能会给同一个 token 打出不同的概率;还有一个异步调度器,决定一条轨迹采样陈旧到什么程度就该被丢弃。这些东西都藏在各个格子的缝隙之间,也正因如此,才会制造出一类格外棘手的 bug。

而这张地图无法告诉你该优化什么。 奖励往下游的每一个环节,都是为了追逐一个你选定的数字而运转的机器。选错了数字,不是功过分配这一格能修的 bug——这是第 3 集要谈的主题,也是这个系列里最古老的问题。

亲手跑一遍,大约十五分钟

「基线能降低方差」这种说法,听起来容易点头认同,但不亲眼看一遍很难真正相信。本季每一集都配有一个可在 CPU 上运行的实验——不需要 GPU,不用下载模型,纯 PyTorch。

第 1 集的实验在同一个任务、同样的随机种子下,分别跑有基线和没基线的策略梯度,并画出更新的方差。你要看的重点不是有基线的版本分数更高,而是没有基线的版本最终也能达到同样的效果,只不过一路剧烈震荡。去掉基线并不会让估计量出错,只会让它变得代价高昂。正是这个区别,让基线用了好几年才成为标准做法——而如果一篇文章只报告最终分数,这个区别根本看不出来。

接下来会讲什么

五集,一个循环,每一集都为下一集铺路。

第 2 集会正式打开功过分配这一格——对数导数技巧、基线、优势值,以及从 REINFORCE 到 PPO 再到 GRPO 这一条连贯的论证脉络。第 3 集追问:如果记分牌本身就是错的,会怎样?答案是,经济学家早在 1975 年就把这条规律写下来了。第 4 集讲的是,当精巧的算法遇上长序列和过期的轨迹采样,会发生什么。第 5 集讲的是,当模型不再只是生成文字,而是开始在一个会回应它的世界里采取行动。

从这一集里带走一件事:下一个缩写出现时——它迟早会来,很可能这个月就来——不要问它是什么,要问它改的是哪一格。 这个问题,从任意一篇摘要出发,大约九十秒就能回答,它会告诉你这篇论文跟你当前项目里正在出问题的地方是否相关。

第 1 集,选自《智能工程历险记》第一季——The Consequence Engine(意为:驱动后果的引擎)。可运行的实验、图表以及完整的五集故事线都在系列原文里。文中的每一条论断在原文中都按类别标注——定义、推导、证据、工程取舍、开放问题——比喻可以用来引出一个论断,但绝不作为论断的证据。本文不含任何雇主或客户的材料。—— Paul Jialiang Wu ·agentic-portfolio-lovat.vercel.app

参考文献

  1. Guo, D. 等(2025)。DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.(中译:DeepSeek-R1:通过强化学习激励大语言模型的推理能力) AIME 2024 pass@1 数据的出处(R1-Zero 从 15.6% 到 71.0%;R1 约为 79.8%),以及基于规则的准确率+格式奖励设计的出处。 arxiv.org/abs/2501.12948
  2. Shao, Z. 等(2024)。DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.(中译:DeepSeekMath:拓展开源语言模型数学推理能力的边界) 提出 GRPO——用组内相对基线取代已学习的评论家网络。 arxiv.org/abs/2402.03300
  3. Yu, Q. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. Clip-Higher 与 Dynamic Sampling;在 Qwen2.5-32B 上于 AIME 2024 取得 50 分,对比 DeepSeek-R1-Zero-Qwen-32B 的 47 分,且训练步数仅为其 50%。 arxiv.org/abs/2503.14476
  4. Liu, Z. et al. (2025). Understanding R1-Zero-Like Training: A Critical Perspective(Dr.GRPO)。指出了 GRPO 中的长度偏差与标准差归一化带来的难度偏差。 arxiv.org/abs/2503.20783
  5. Williams, R. J. (1992). Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine Learning 期刊。REINFORCE 的原始出处。 link.springer.com/article/10.1007/BF00992696
  6. Sutton, R. & Barto, A. (2018). Reinforcement Learning: An Introduction,第 2 版。本文所用的正式定义出处。 incompleteideas.net/book/the-book-2nd.html
  7. Ahmadian, A. et al. (2024). Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs. arxiv.org/abs/2402.14740