Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅

学习工程学 · 四个研究窗口 · 一个现场案例研究

硬核想法总会反弹。三百年配方,交给智能体执行,才能让它真正黏住。

作者:Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 2026-08-01 · 案例研究:《苦涩的教训》,全情投入吃透了

一分钟速览——你能带走什么

四个研究窗口——30天、30个月、30年、300年——达成共识:AI学习工具优化的是「消费」,而持久的学习则住在「生成」那一侧(间隔重复始于1885年,提取练习始于1917年,还有教学复述、动手画图)。而那片墓地(学习风格、快速阅读)证明了:受欢迎程度从来预测不了能否活下来。把AI瞄准生成,索要凭证,把最后一步交还给人类。

上周,我把 Rich Sutton 的《苦涩的教训》——这篇论证「搭载算力的通用方法胜过人工雕琢的专家知识」的文章——投喂给了一整套AI智能体。这套系统学会《苦涩的教训》的方式,恰恰印证了这篇文章自己的预言:不是靠我手工写一份摘要,而是靠运行通用、可验证的机器流程来学。这种自我印证的递归感,挺好笑的。而这套机器流程实际上做的事 一点也不新鲜。这是一套有三百年记录可查的学习方法—— 而如今几乎每一款上市的 AI 学习工具都绕开了它。

消费陷阱(过去 30 天告诉我们的事)

翻遍任何一份当前工具盘点,模式都一模一样:上传论文,得到一份 摘要、一段播客、一支视频概览、几张记忆卡片。 NotebookLM 从 2023 到 2026 的演进 ——Deep Research、支持 80 种语言的语音概览、电影感视频、自动生成的测验——工程上确实令人惊艳,学生们现在看待它 "less like a chatbot and more like a personalized research environment."(中译:与其说它像个聊天机器人,不如说它更像一个为你量身定制的研究环境。) 但请注意每一个箭头的方向:内容都朝你 流来,早已替你嚼碎。这就是 消费。而一个世纪的学习科学给出的一个不太舒服的发现是: 持久的学习,恰恰不会发生在 消费 这一端。反复重读——「接收摘要」的手工版本——正是那个在一次次研究中败下阵来的策略。

什么活过了 300 年(什么又死得很响)

🏺 过去300年(last300years) · 时间窗口 1726—2026 · 4 位幸存者排名 · 附反面案例集

1 · 间隔重复(1885 年被测量,已 141 岁)。Ebbinghaus 从他自己的音节 实验中得出: "with any considerable number of repetitions a suitable distribution of them over a space of time is decidedly more advantageous than the massing of them at a single time"(中译:只要重复次数足够多,把它们适当分散在一段时间里,明显要比集中在一次完成更有利。) (《记忆》,1885 年)。此后在 317 项实验、共 839 次测评 中被复现(Cepeda et al., 2006),如今已 成为医疗专业教育的标配。 经受住了从纸质到软件这一载体变迁的考验(SuperMemo 1985、Anki 2006)。

2 · 提取练习(1917 年成型,已 109 岁)。 Gates 的背诵研究 让孩子们抬起头、脱离书页背诵;一个世纪之后 Roediger & Karpicke (2006) 在成年人身上测出了同样的效应:一周之后,做提取练习的人记住了 61%,而重复阅读的人只记住了 40%。 最古老的声音和最新的证据,跨越 89 年达成一致。

3 · 教是最好的学(格言出自 1801 年,实证支持则是现代才有的)。Joubert 那句 "to teach is to learn twice"(中译:教一遍,等于学两遍),后来变成了可被测量的 门徒效应(protégé effect): 在Fiorella & Mayer 对生成式学习策略的综述中, 讲给别人听是所有被测试的干预手段里效果最强的几种之一。

4 · 自己动手画出来(典型案例出自 1810 年代,已有约 210 年历史)。Faraday——一个没受过正规数学训练的装订学徒——把自己的听课笔记装订成册,"with detailed illustrations, thoroughly indexed"(中译:配有详尽的插图,并做了完整索引), 历史学家们认为这些笔记本体现的是创造性科学的主动组织过程, 而不只是被动的记录。现代研究的测量结果是:由学习者自己动手画图,在 28 项研究中的 26 项里跑赢了对照组,效应量中位数 d = 0.40.

⚰️ 与之同时代却被淘汰的方法们——这些方法当年比任何幸存者都声势浩大,最终却在检验中败下阵来:形式训练说(「学拉丁文能锻炼思维」),这套 19 世纪的主流共识,被Thorndike 与 Woodworth 在 1901 年做的迁移实验; 学习风格,这在 Pashler, McDaniel, Rohrer & Bjork (2008) 发现「按学习风格匹配教学」缺乏充分证据之前,曾是一个数十亿美元规模的产业;速读睡眠学习,二者都已被基础心理物理学否定。给 2026 年的教训是:在这个领域,受欢迎程度从来预测不了能否存活。碰到任何新的 AI 学习工具,都不妨拿这个「墓地问题」问一问。

过去 30 年测量出了什么,过去 30 个月又改变了什么

过去三十年把这些幸存策略变成了数字——效应量、元分析、 Fiorella & Mayer 的八种生成式策略 (总结、绘制概念图、画图、想象、自测、自我解释、讲授、实演)——以及 一次体裁上的转变:3Blue1Brown(2015 年创立,如今已有 785 万订阅者)证明了,把一个概念的运作机制动画化,可以把研究生级别的 数学带给数百万观众,随后它还开源了 manim 引擎,让这门手艺本身变得可执行、可分享。

接着,过去 30 个月把交付成本几乎压到了零。在一项哈佛的随机对照实验中, 使用经过教学法调优的 AI 辅导工具的学生,用更短的时间学到了超过两倍的内容 而不是同一门课的主动学习课堂(Kestin 等,194 名学生)——作者将此 归功于tuning to pedagogical best practices(中译:对教学法最佳实践的调优),而非模型本身。在尼日利亚埃多州,一项 世界银行随机对照试验 显示,六周有护栏约束的 GPT-4 辅导带来的进步,相当于 1.5–2 years of business-as-usual schooling(中译:一年半到两年常规教学的效果), 使其成为有史以来经过严格检验的教育干预中,成本效益最高的几个之一——同样 关键的是,提示词的设计是为了促进推理,而非直接给出答案。两者呈现出同一种模式:AI 会放大 你把它指向的那一端,无论是消费端还是生成端。把它指向生成端。

一个意图,四个器官,每条断言都设了关卡

所以这就是我现在在用的方法:一句话交给路由器。我的 allin-anything 超级仓库索引了 一整个智能体仓库家族,每个仓库都有机器可验证的状态。这次的意图是:

"learn The Bitter Lesson deeply, with an animation for each key idea, and sketch its two curves by hand."(中译:“深入学习《苦涩的教训》,为每个关键概念配一段动画,并手绘出它的两条曲线。”)

一个确定性的路由器(它给出的判定是 pytest 用例,不是凭感觉)点出了三个器官,且每一个器官 own test suite ran green before it was trusted(中译:自己的测试套件全部跑绿之后,才被信任): master-anything ——负责 教后即讲式的会话结构(15 个测试 + 冒烟测试)· animate-anything ——可执行的动画 制作工艺,一个 10 项检查的风格检查器,得分 100/100 · penecho ——一块从笔到数字画布的工具,200 个测试 锁定在一个固定提交上。这条链条随后产出了 five animated sessions(中译:五段动画讲解),还有这张图—— 以真实笔触绘制,由画布自身的渲染器导出:

Hand-drawn on penecho: the human-knowledge curve plateaus while the compute curve crosses it and keeps rising

《苦涩的教训》的两条曲线——人类先验早早触顶,算力持续攀升——用真实墨迹画了出来

把这条流水线的所作所为映照到那些幸存者身上:它画了出来(Faraday 的做法,d = 0.40),它教后即讲环节(Joubert 的做法,即门徒效应),它把机制动画化,而不是把结论动画化(Sanderson 的做法),最终成果以原始文献自身那些可供出题的论断收尾(Gates 的做法)。唯一一件没有任何一个组件做的事:发布。那是我按下的那一下——每一步不可逆的操作,都值得有这道人类闸门。

四种收获,老老实实对号入座

体验
你用手真正接触到了这个想法——是画在画布上的一笔一划,不是滑动屏幕的手势。证据线:生成式绘图,26/28 项研究呈正向结果;具身操作被列入 Fiorella 与 Mayer 的八大策略之一。
理解
每个环节都逼着你先用自己的话和图把机制讲一遍,再往下走。证据线:提取练习 61% 对 40%;教后即讲/门徒效应,是被测试过的生成式策略中最强的几种之一。
关联
路由器本身就是一台关联引擎:同一个意图,串起了一个数学动画仓库、一块手写画布,还有一个学习回路——想法在你整套工具家族里被互相引用、彼此印证。证据线:Mayer 的多媒体原则——文字加上与之对应的图像,效果胜过纯文字。
信念
每一个组件都带着自己的退出码。你信这个成果,是因为你亲眼看着它一道道闸门通过——信念,就是理解加上凭证。证据线:反面案例集——那些跳过验证环节的领域(学习风格、速读),一遇到它就现形死亡。

自己动手试试(用不用我的仓库都行)

  1. 选一份啃不动的材料——一篇论文、一份简报、一章你以前碰过就弹回来的内容。
  2. 提出一个要求生成的意图:「learn X deeply, with an animation per key idea, and a hand sketch of its central figure.」(中译:深入学习X,为每个关键概念配一段动画,并手绘出它的核心图示。)动词比工具更重要。
  3. 把任务路由给「器官」,而不是摘要生成器 ——一个会话结构器(教后即讲式)、一个动效工具(呈现机制而非装饰)、以及一样你的手能碰到的东西:触控笔、钢笔、白板。
  4. 索要凭证 ——如果某个AI工具声称能帮你学习,问问它有没有相当于「退出码」的东西。没有闸门,就没有信任:这条规则,是三百年墓地里的亡魂在说话。
  5. 把最后一步留给人类 ——发布、决定、行动。尼日利亚那项RCT之所以有效,正是因为有护栏,而不是尽管有护栏。
  6. 把回顾的路程分散开 ——一周后重访这份成果,先复述,再重读。Ebbinghaus从1885年起就没说错过。

递归式的点睛之笔

《苦涩的教训》说的是:借助算力的通用方法,胜过人工精心打造的知识。而这套存活了三百年的学习方法,正是同一类通用方法——画出来、 教出来、测出来、隔开时间练,无论学的是什么科目 ——如今智能体已经让它的执行成本彻底崩塌,就像GPU让搜索与学习的成本崩塌一样。人工精心打造的摘要,就是学习这件事上的 「人类先验」:起步很快,天花板很低。而生成式的循环,才是那条算力曲线。 这张图会怎么收尾,你早就知道——因为你看着我把它画出来了。

🔬 溯源 · 四个时间窗,一份契约

🗞 过去30天:NotebookLM 2026版功能集与学生使用模式 (Glasp, DigitalOcean) · 📅 过去30个月: Harvard AI导师RCT, World Bank尼日利亚RCT · 🌳 过去30年: Roediger & Karpicke 2006, Fiorella & Mayer, 3Blue1Brown/manim · 🏺 last300years: Ebbinghaus 1885, Gates 1917, Faraday's notebooks (Royal Institution), 附赠:反面案例 Thorndike & Woodworth 1901, Pashler et al. 2008。 诚实的局限:AI 导师的证据积累不到三年,且两项随机对照试验都把功劳归给了各自的 教学护栏设计——遇到没有说明设计细节、就宣称「AI 能让学习更好」的说法,请用你 对待「学习风格」推销话术的同等警惕心去对待它。案例研究的凭证(测试数量、退出码、手绘 导出稿)都在 allin-anything repo 的 演练记录与 CI 历史里。

Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 案例研究:《苦涩的教训》,一次全情投入的学习 The Bitter Lesson, learned all-in · github.com/wjlgatech/allin-anything