AI 原生系列 · 学习
我不再死磕 PhD 了。(Physical Head Damage,物理性脑损伤。)
1 分钟速览——你能带走什么
这是一种学习方法的第一次内容测试——它拒绝让你把思考外包给 AI。同一场考试,两位学习者:被动式刷题记忆,得分为 NOT_YET;玩耍/教学/构建循环,得分为 PASS——由一个专门用来识破口号的评判者打分。诚实的 n=1 样本、真实的产出物,以及那条让学习与工作合而为一的设计法则。
掌握高难度技术材料的旧方法:把幻灯片刷到头痛为止,记住一堆口号,一遇到稍微变个样的真实问题就现出原形。我构建了一种方法,改为靠玩耍、教学与构建来学习——并对它做了第一次诚实的测试。

每个工程师都懂这种苦活儿。你打开十四份讲义 PDF,画重点,反复读。你的头开始疼——这就是真正的 PhD,Physical Head Damage(物理性脑损伤)——到最后,你能背出「智能体比工作流更强大」「上下文工程很重要」这类话。可一旦真正的设计问题冒出来,形态和幻灯片上的稍有不同,记忆就瞬间蒸发。你学到的是词句,不是那件事本身。
我不觉得这是个自律问题,我觉得这是个方法问题——而且是可以解决的。于是我基于一条法则,构建了一套学习方法,叫master-anything,然后做了一件大家通常会跳过的事:老老实实地测试它,把证据原样拿给你看,包括那些还不够扎实的部分。
唯一的法则:AI 举着脚手架,人握着笔
所有 AI 学习工具的陷阱在于,它太乐意替你把思考全包了。让它解释一下智能体(agent),它就给你写出一段漂亮的解释——你读一遍,点点头,然后忘掉,因为读一段解释并不会带来学习;自己生成一段解释才会。(学习科学把这个叫作生成效应,是该领域被反复验证次数最多的发现之一。)
所以 master-anything 的设计,就是要把那个费力气、需要生成内容的动作,留在人这一边。AI 负责检索、组织、反馈、校验、呈现、记忆——所有围绕思考外围的事。但解释得由你来写。修复方案得你先试,答案揭晓之前你得先动手。结果出来之前,你得先预测。AI 举着脚手架,你握着笔。把思考外包给 AI 的可能性,从设计上就被消灭了。
为什么这让学习和工作变成同一件事:如果产出是由你自己的生成性动作完成的(AI 只是搭了脚手架),那么工作和学习就是同一项活动。你收工的时候,手里既有一件真实的作品,也有一份经过验证的理解——都来自同一份努力,而不是二选一的取舍。
测试:同一场考试,两个学习者
材料:来自斯坦福 Modern Software Developer 课程中「如何设计一个 coding agent」的单元——智能体循环(agentic loop)、上下文工程、何时该加一个工具、workflow 与 agent 的取舍。考试形式:不是选择题,而是迁移探针——一些全新的场景,光靠死记硬背答不出来。另有一个专门找茬的独立评判者,负责判断机制理解,而非流畅度,专为识破口号而设计。(这点很重要:研究显示,自我评分的测验会把分数虚高 3–6 倍;迁移探针正是解药。)
学习者 A 走的是死磕路线——读过、能背。学习者 B 走的是 master-anything 循环——先压缩原始材料,再教一遍讲给别人听,接受探测,把理解说出来。两人接受同样的三个探针测试。来看一个真实、有难度的探针示例:
An agent refactors 40 files over several hours, across separate
sessions — no single context window holds the job. Mid-session 3
it needs to know: was file X already done in session 1, and what
naming convention was chosen? Session 1's conversation is gone.
How does that information reach session 3?
判决结果(同一位评判者,截然相反的结果)
| 学习者 | 判决 | 评判者的原话 |
|---|---|---|
| A —— 死磕型 | 🟡 NOT_YET(尚未达标) | "substitutes slogans for any causal mechanism — 'agents are powerful', 'good context', 'multi-agent is good for big problems' — never engaging the specific constraints the probes introduce"(中译:“用口号替代任何因果机制——‘智能体更强大’‘上下文要好’‘多智能体适合处理大问题’——始终没有触及探针引入的具体约束条件”) |
| B —— 玩耍/教学/构建循环型 | ✅ PASS(通过) | 三个探针全部展现出迁移能力(子任务可枚举性、会话开始时读取的持久状态、耦合检测) |
学习者 B 对上述探针的回答,并没有背诵“状态存在于窗口之外”这句话,而是用上了这个机制:第三次会话不需要旧的对话记录——它会在启动时读取持久化的产物(一份进度清单、一份 git diff、一份决策文件),只按需拉取、即时获取。这才是迁移,也正是死记硬背伪装不出来的东西。
证据薄弱之处(毕竟伪造一个 ✅ 是不可原谅的事)
我不会把这事夸大其词。这个测试到底是什么、又不是什么,说清楚:
- n=1,而且学习者 B 是模拟出来的,不是真人。 这证明了两件真实的事——这套评判者确实能区分死记硬背与真正的迁移,而且这套循环产出的成果是真实的——但它终究不是一次针对真人的随机对照试验(RCT)。真人的数据点(一位真实用户,换了个不同的主题,「愿意再来一次」打分 4/5)是另外单独、样本很小的一项;真正过硬的证据,还得看接下来的企业群体测试。
- 根本没有官方的「Anthropic Claude Architect Exam」。 这里的考试,是我根据课程自身的学习目标构建出来的迁移评估。真正的外部认证会是更有力的验证,但它目前还不存在。若声称有,恰恰就是这个方法本要抓的那种「用口号顶替实质」的失败。
- 只验证了当下的效果,尚未验证长期效果。 持久保留需要一次+7天的探测,这个主题还没做过。
靠玩、靠教、靠做来学习——不是死磕
「玩/教/做」这条路不是一句空洞的口号,它是真正的机制。 教 对应的是生成效应(回讲本身就是考试)。 玩 ——把一个概念变成一首歌或一个会动的虚拟形象——是多模态编码,让它记得住,也让人觉得有意思。 做 ——跑一个真实的智能体循环、修一个真实埋下的 bug——是证明能力的实物证据。这三件事,没有一件是死磕。它们都让笔一直握在你自己手里。
死磕带来的是 Physical Head Damage,以及一碰到真实问题就失灵的记忆。而这个循环带给你的是一场通过的迁移考试、一件你能留下的作品,还有——这是测出来的,不是想当然的——一次你还愿意再来一遍的会话。同样高难度的技术材料,结果却截然相反。区别就在于,笔握在谁手里。
这里的一切都是真实的、可查验的——考试题目、两份讲解、探测题、判定结果的 JSON、以及主线事件记录。方法本身、老老实实标出的局限,还有那条设计法则,全部公开。
继续阅读
属于 AI 原生系列。工具全部开源在 github.com/wjlgatech——笔在你手里。