AI 原生系列 · 智能体化工程
我的 AI 联合创始人连轴转了 48 小时。最精彩的时刻,是它一次次的拒绝.
一分钟速览——你能带走什么
两天,一个人类,一个 AI 联合创始人:一门课程围绕真实实践被重构,会教学的歌曲,一面会跳舞的镜子,一套接通的辅导平台,还有第一批真实学习者数据(趣味度:4/5)。真正的护城河出人意料——不是速度,而是这个智能体每一次拒绝伪造结果的时刻。
两天的公开构建,搭档一个把「验证」当宗教信仰的智能体。我们上线了六样东西,搞砸了两样,测量了一个人类——护城河最后落在了诚实上,而不是速度。
周二,我让 AI 联合创始人审阅一门培训课程。换一个客气的智能体,大概会顺手改几个错别字。而我的这个,读完了全部 22,740 字,把这门课定性为「内核空洞的 B+ 稿子」,还指出讲师稿里声称"every example is a real session I ran"(中译:“每一个案例都是我真实跑过的会话”)——可这些案例其实从来没有被真正跑过。
接着它做了一件我如今格外珍视的事:拒绝让那句话就这么发出去。
接下来的 48 小时,是我职业生涯中最奇特、也最富有成效的一次协作。这是一份诚实的成绩单——包括那些搞砸的部分。
这些都是凭据(因为没有数字支撑的故事,只是一种感觉)
| 已交付 | 凭据 |
|---|---|
| 把一门讲座课程重建为实战赋能项目 | 「讲述:实操」比例从 100:0 变为 40:60;伪造的演示文本被替换为真实运行的实录 |
| 教框架的歌 | 在授权清晰的开放模型上生成了两首带节奏的曲子——一首副歌把怎么写提示词唱得明明白白,一首是献给智能体化循环的主题曲 |
| 一面「魔镜」 | 摄像头 → 骨骼识别 → 发光的虚拟形象随音乐跳你的舞,约 200 行代码,完全本地运行 |
| 一个已部署、已接通的辅导平台 | 本地运行的开源主干(一个 26k star 的仓库):知识库来自一篇真实论文,含测验生成、每轮 0.0004 美元的遥测 |
| 第一个真实学习者数据点 | n=1(就是我):完成了教学复述,趣味脉搏 4/5,第 7 天的提取练习探针已排期 |
| 一个软磨硬泡都不好使的严苛考官 | 生成迁移探针——全新情境,从不改头换面地套用旧题——考察的是机制理解,而非流利程度。黄金测试:深入讲解 → PASS;流利的空话 → NOT_YET |
最后这轮冲刺的总计费 API 成本——考官、可靠性链条、数据主干全算上:不到 0.25 美元。比我盯着它干活时喝掉的那杯咖啡还便宜。
拒绝,才是真正的产品
人人都在演示自家 AI 能做能 做到。这 48 小时教会我的是:价值恰恰藏在一个精心架设的智能体不会 做的事里:
它不会把虚构包装成事实。 课程里的演示文字记录本是「为了真实感而编写的」。这个智能体在真实仓库上跑了一次真实会话,把真正的计划、真正的单行 diff、真正的绿色测试全部记录下来——然后把幻灯片改成了与现实相符的样子,而现实反而没那么 戏剧化,却因此更有说服力。虚构版本里 AI 英雄般地修好了两个失败的测试;真实运行呢?不过是平淡无奇的一次成功。这份诚实,如今成了讲座的开场白。
它不会伪造一个排名。 我们的歌曲生成器会按提示词贴合度给不同版本自动排名。当时排名模型没装上,于是报告写的是「按第一版排序(CLAP 不可用)」,而不是编一个分数出来。一件小事,却会累积成大不同。
它不会把故障藏起来。 演示当晚,托管的音乐引擎在试运行中途挂掉了。这个智能体没有留下一个沉默的空白,而是把故障记了下来,第二天早上搭建了一条「备援链路」(托管引擎 → 本地引擎 → 一句诚实的「这首歌没能生成——我们跳过它继续」),然后拿这条还处于故障中的服务,对这条链做了一次实况测试。测试「优雅降级」能力最好的办法,就是遇上一次真实的故障——而我们恰好赶上了。
这里的规律是: 一个诚实的 ❌ 胜过一个伪造的 ✅——这不是一句口号,而是一个 exit code(退出码)。我们仓库里的每一个论断,现在都带着证据,或者一个 ⚪「未证实」的标签。原来,诚实是可以被工程化出来的。
科学带来的反转
中途,我们对 30 年的学习科学文献做了一次深度研究扫描(110 个智能体,每条论断都经过对抗式验证)。三个发现,重新排布了整个路线图:
1. 教育界最出名的那个数字,是个神话。 Bloom 的「2-sigma」辅导效应无法复现——真实的人类辅导效果是 d≈0.79,而软件辅导系统在统计意义上已经与之持平。人人追逐的那个标杆,实际只有传说中的三分之一,而机器已经悄悄够到了它。
2. 与教学内容对齐的测评,会把结果夸大 3 到 6 倍。 辅导系统在用自己教材出的测试上能拿到 0.73 分,换成迁移测试就只剩 0.13 分。这正是为什么我们的考官只问全新场景 的问题。如果你的学习产品自己出题自己判卷,那你的指标就只是营销话术。
3. 没人测量过“乐趣”。 速度、深度、留存——几十年的证据都在。乐趣这一维度呢?一个已验证的结论都没有。这意味着我们这周才开始收集的乐趣数据集(样本量:一位兴奋的人类,4/5 分)小得可怜,但它诚实——而且据我们所知,在这个领域里几乎独此一份。
一个 15 岁少年该从中学到什么
AI 联合创始人不是一个话更多的聊天机器人,它是一个循环:目标 → 构建 → 验证 → 拒绝造假 → 学习 → 重来。 “验证”和“拒绝”这两步藏着全部的价值,因为它们正是人类疲惫时会跳过、智能体被拙劣驾驭时也会跳过的步骤。驾驭工程——契约、人类闸门、证据分级——就是让诚实的路径变成最省力路径的手艺。
build the thing
→ test it against reality (not against vibes)
→ when it fails, say so, loudly, in the log
→ bank the lesson where the next run will find it
→ repeat until the demo is just... true
两天,六次发布,两次诚实的故障——如今都成了承重的功能。一个人类在学习 transformer 注意力机制时切实感受到了乐趣。还有一个越来越强烈的直觉:在智能体时代,信任才是唯一能复利增长的演示。
这里的一切都真实可查——课程、歌曲、镜子、考官、连同其 ROI 账本的逐次决策日志。工具已开源,见 github.com/wjlgatech。
继续阅读
本文属于 AI-Native 系列。工具已开源,见 github.com/wjlgatech——发布按钮的所有权在你手里。