AI 原生系列 · 学习工程学
我把《苦涩的教训》喂给了我的智能体,结果它先把我的学习方法给吃了。
一分钟速览——这篇文章能给你什么
Sutton 的《苦涩的教训》说,搭上算力顺风车的通用方法,终将胜过人工雕琢的知识——而你的学习习惯,也画在同一张图上:划重点、反复读,是人工雕琢的先验知识(起步快,很快触顶);画图、教学、自测和间隔安排,是不断攀升的通用方法。智能体只是让这条好的循环几乎变得免费。一个思维模型、十条经过验证的参考文献、真实的墨迹,还有机器永远不会替你做的那一步:点击发布。

2019 年我读了 Rich Sutton 的《苦涩的教训》,然后做了受过教育的人面对重要文章时会做的一切:点头、划重点、跟同事说这写得「太对了」。快速小测验,七年后的今天——我能背出其中三句话吗?不能。我的荧光笔也不能,尽管它全程都在场。
这篇文章,一口气讲完
Sutton 的开篇第一句,原文照录[1]:
国际象棋败给了搜索,不是大师直觉。围棋败给了自我对弈,不是棋谚。语音 败给了统计,不是音素。视觉败给了习得特征,不是手绘边缘——这是Sutton 亲自梳理的四次逆转[1]。每一次,那些曾满怀爱意地编码人类洞见的研究者, 都眼睁睁看着一个吞噬算力的通用方法在硬件跟上的那一刻呼啸而过、把他们甩在身后。这段动画按领域重演了这一幕——灰色是 手工方法;橙色姗姗来迟、来势汹汹:
启发式 → 搜索
棋谱模式 → 自我对弈
音素 → 学习
特征 → CNN
七十年,四个领域,一次次反转——直到尝到苦涩
这个笑话,我花了七年才明白过来
接下来这段,我真希望能倒回2019年。这篇文章白纸黑字地警告过:[1]:
现在再看看我当时是怎么学习这篇文章的。划重点——凭我自己的主观判断猜哪句话重要。写摘要——我手工做的压缩。点头称是——我最拿手的、不费一点脑力的推理。我整套学习方法,说白了就是关于我自己大脑如何运作的、手工打造的人类知识。 我居然是靠一套违背这篇文章本意的方法,去理解这篇文章。《苦涩的教训》里其实早就给我这种人留了一条但书——结果那句话,还被我划了重点。
这篇文章的核心思维模型只有一个:你的学习方法,也在这同一张双曲线图上。直觉型方法——划重点、反复读、写摘要——上手快,但很快就会撞上你自我反思能力的天花板。生成型方法——动手画出来、讲给别人听、自我测验、间隔安排——起步慢,却能持续攀升,因为它们把时间(如今还有算力)转化为记忆,就像搜索和学习把算力转化为能力一样。同一张图,你也在上面。
一个世纪的证据是怎么说的(这部分可不是凭感觉)
认知科学早在计算机出现之前就跑过这场比赛,结果同样是通用方法 获胜。 重读输给提取: 学习一周后,做提取练习的人 记住了61%,而重读的人只记住了40%(Roediger & Karpicke, 2006[2])—— 这一点早在1917年Gates的课堂背诵实验中就已被预见[3]. 画出来胜过盯着看: 在28项研究中有26项,学习者自己动手画图的效果都优于对照组,中位效应量 d = 0.40[4]. 教别人胜过自己消化: 在Fiorella & Mayer对生成式策略的综述中,讲给别人听是被测量到的 最强干预手段之一[5]. 间隔胜过 临时抱佛脚,这句话从1885年起就已是原话[6]:
这里还有个内行人才懂的讽刺:心理学几乎老早就知道这一切, 教育界却大多选择无视。Frank Dempster 1988年发表在 American Psychologist 上的论文标题直接就叫 "The Spacing Effect: A Case Study in the Failure to Apply the Results of Psychological Research" (中译:间隔效应:一个心理学研究成果未被应用的案例研究)[7] ——这是这个领域 复现效果最好的发现,却就这么被束之高阁。我们从1885年起就掌握了正确的学习算法, 却依然选择重读,因为重读感觉像是在学习。流畅错觉之于学习, 大概就相当于燃素说之于化学:一个自圆其说的错误信念。而你的荧光笔,正是一位营销做得极好的人类先验知识推销员。
过去30个月里真正改变的,是运行正确算法的成本。 一项哈佛的随机对照实验显示:用上按教学法调校过的AI导师的学生,比同一门课的主动学习课堂 学得更多,用时更少[8]。世界 银行在尼日利亚做的一项随机对照实验显示:六周有护栏约束的GPT-4辅导,带来的进步 相当于1.5到2年常规学校教育的效果[9]。两支团队都把功劳归给 教学法本身,而不是模型。算力没有取代生成式学习循环,它只是让这个循环变得便宜了。
于是我把这篇文章本身,也当成了实验对象
给 agent 路由器扔一句话:"learn The Bitter Lesson deeply, with an animation for each key idea, and sketch its two curves by hand."(中译:深入学习《苦涩的教训》,为每个关键概念配一个动画,并手绘出它的两条曲线。) 这个路由器——一个判决全靠 pytest 用例来裁定的确定性程序,就在我的 allin-anything 超级仓库里——点名了三个「器官」,每一个都得先跑通自己的测试套件 才会被信任:一个教后可述的学习闭环(15 个测试加冒烟测试)、一个可执行的动画制作规则检查器(100/100),还有 penecho,一个笔到数字画布的工具(在某个锁定提交上跑过 200 个测试)。接着,这条流水线做了科学要求它做的事:画图、做动画、把一切都组织成方便教后可述的结构。这张图是真墨水——我在 penecho 画布上的笔触,由它自己的渲染器导出:
同一张图变成了动画——灰色曲线趋于饱和;橙色曲线在画面结束时仍在加速
我的智能体们创作的五个动画里,还有两个,因为机制也值得动起来。 Sutton 那两种能持续扩展的方法[1]——搜索是一棵随预算变宽的树,学习是一颗球,没人告诉它谷底在哪,它自己也能找到:
搜索随预算变宽(蓝色)· 学习沿损失曲面下降(橙色)
还有反模式,也做成了动画——为什么先验会变成天花板。一个学习者在我们设法编码进去的那个盒子里长大,撞到了盖子;另一个朝着算力的方向生长,没有撞到:
这个盒子本身,就是那道天花板——对 AI 系统如此,对学习方法也一样
这条链条执行到底,然后做了一件我坚持机器永远不该自己做的事:它 停下来了。发布这个页面的,是一次人类点击——我的点击。我的智能体们画出了证明自己优越性的图表,把它做成了五幕动画,然后礼貌地等待许可,因为人类闸门被焊死在链条定义里,谁要是想拿掉它,测试就会失败。 机器正在赢,但它们赢得彬彬有礼。那天下午,我第一次同时感到自己如此多余,又如此不可或缺。
模式: 押注那些「预算翻倍就变得更好」的方法——无论是在 AI 系统里(Sutton 说的搜索与学习),还是在你自己的学习里(生成与间隔)。
反模式: 把你的内省本身当成流水线来编码——2005 年的视觉特征,1985 年的语法规则,上周二你划的那支荧光笔。早期赢得漂亮,很快就触了顶。
机制: 绘图、讲授、自测这类生成式行为,会强迫你去提取和重构信息,而这正是持久记忆得以形成的关键——恰如搜索与学习把原始算力转化为能力,全程无需人类手把手指导。智能体让这个生成式循环几乎变得免费,但它们取代不了循环本身。
这周就自己试一次(SMART 拆解)
Specific(具体): 挑一篇曾经在你身上碰壁的高密度文本。Actionable(可执行): 第一句话就要求产出——「深入学习 X,为每个关键概念配一段动画,并手绘出它的核心图示」——然后把任务交给能让你产出而非 消费的工具;如果某个工具号称能帮你学习,问一句:它的测试套件等价物是什么? Measurable(可度量): 七天后,先复述再重读——这正是 Gates 的 1917 年套路[3];如果你无法凭记忆重构那张核心图示, 那说明是方法失败了,不是你。Timeboxed(有时限): 整个循环一个下午就能跑完;我就是这样做的, 而且我留了收据[10]. Relevant(相关): 你正在读的这篇文章,讲的正是算力战胜先验知识——而当下这个十年,恰恰让算力几乎变得免费。这张图,不会等你。
参考文献(每条链接均在发布时核实过)
- Sutton, R.(2019)。《苦涩的教训》。所有引文均逐字取自原文(发布时逐字符核对抓取)。
- Roediger, H. L. & Karpicke, J. D.(2006)。Test-Enhanced Learning: Taking Memory Tests Improves Long-Term Retention(中译:测试增强学习:记忆测试提升长期记忆保持率). Psychological Science 17(3) — 一周后保留率 61% 对 40%。
- Gates, A. I. (1917). Recitation as a Factor in Memorizing。Archives of Psychology, №40.
- Schwamborn et al. / Fiorella & Mayer (2016). The generative drawing principle in multimedia learning——在 28 项研究中的 26 项里,绘图组胜过对照组,中位效应量 d = 0.40。
- Fiorella, L. & Mayer, R. E. (2015). Learning as a Generative Activity。Cambridge University Press——书中列出的八种生成式策略中,「教别人」是效果最强的几种之一。
- Ebbinghaus, H. (1885/1913). Memory: A Contribution to Experimental Psychology,第 8 章——引文逐字取自 Ruger 与 Bussenius 的译本。
- Dempster, F. N. (1988). The Spacing Effect: A Case Study in the Failure to Apply the Results of Psychological Research. American Psychologist 43(8).
- Harvard Gazette(2024),关于 Kestin 等人的随机对照试验。 Professor tailored AI tutor to physics course. Engagement doubled.——194 名学生,用更短的时间学到了两倍以上的内容。
- World Bank (2025). From chalkboards to chatbots in Nigeria——为期六周、设有护栏的 GPT-4 辅导随机对照试验;增益相当于 1.5 到 2 年常规教学的效果。
- 这次运行的凭证——测试计数、退出码、锁定的提交版本、AutoRunner 日志——都在 github.com/wjlgatech/allin-anything(详细过程:article-to-animated-understanding);在线演示见 allin-anything-demo.vercel.app.
Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 这篇文章的原始六轮会话素材版本,就放在 allin-anything 仓库里;而这篇文章,正是它教给我的东西