让一个十岁小孩独自领一条指令去执行——「做午饭、打扫厨房、别把房子烧了」——一个刚看完三个做菜视频的孩子,会宣布一套「多步骤烹饪策略」,然后把煎饼糊抹得满天花板都是。这一幕,就是自主 AI 的核心问题。一个强大的模型可以把菜谱讲得头头是道、语气无比自信,同时手里的锅铲还拿反了。
模型是一个大脑。而一个自主系统需要的不只是大脑——还要有清晰的目标、眼睛和耳朵、工具、记忆、边界、反馈、测试,以及一个知道灭火器放在哪儿的成年人。这就是全部道理,浓缩成一句话:
自主性不是模型的某个功能。它是一种系统架构。
全篇论点浓缩成一句话:发号施令是下命令;架构设计是造心智。未来不属于更好的提示词——而属于更好的循环。
心智模型:闭环厨房
聊天机器人是个美食评论家:你问他煎蛋卷怎么做,他写出一篇文采斐然的回答,然后就打道回府了。而智能体是厨子:他检查食材,挑一口锅,发现炉火太旺,调小火,尝一口味道,一直忙活到蛋卷真正做好为止。这就是一个循环:
目标 → 观察 → 思考 → 行动 → 检查 → 学习 → 重复
关键词不是思考——而是循环。有计划没行动,是一场 TED 演讲;有行动没观察,是卡在沙发底下的扫地机器人;有观察没纠正,是用 4K 画质拍下抢劫全过程的监控摄像头。只有当系统在意图与现实之间反复往返时,自主性才会出现。(ReAct 这一路研究把这点形式化了:将推理与行动、观察交织在一起,效果胜过单独使用任何一种。)
1 · 目标:一个终点,而不是一种感觉
「帮忙搞定这个项目」不是目标,而是一团穿着商务休闲装的迷雾。一个有用的目标,描述的是一个你可以核实: "Upgrade this service from Java 11 to 17, preserve all public API behavior, pass the test suite, and open a PR explaining every breaking change."(中译:将此服务从 Java 11 升级到 17,保留所有公共 API 行为,通过测试套件,并提交一个 PR 说明每一处破坏性改动。) 这里面包含了期望的结果、约束条件、证据,以及交付条件。
智能体极擅长制造看似可信的动作——检查十二个文件、重命名两个变量、写出四页笔记,营造出一种忙碌的情绪氛围,而袜子却还挂在台灯上没收。所以,一个投入生产的智能体需要一份目标状态契约:成功标准、禁止结果、时间与成本预算、所需证据、升级规则,以及“我卡住了”的定义。契约越清晰,钻空子赢一场想象中的游戏的余地就越小。
2 · 感知:智能体必须看见现实
厨师不能光盯着菜谱就做出午饭,他得打开冰箱。智能体需要能实时访问文件、数据库、API、日志、网页、测试结果,以及上一步行动带来的后果。这就是所谓的接地——没有它,智能体就不是在现实中运作,而是在一个关于现实的故事里运作。这正是幻觉演变成实际行动的过程。聊天机器人编造一个文件名只是让人恼火;智能体编造一个文件名并删掉真实目录,那可就得请法务部出面了。
假设是廉价的,证据是昂贵的。千万别把两者的账单弄混。
所以,工具返回结果、日志和检索来源都必须是系统状态中的一等公民——模型相信什么、工具返回了什么、什么已经被验证过、什么仍然不确定,这是四件完全不同的事。
3 · 规划:分步思考,别死守第一步不放
冰箱里有鸡蛋,没有牛奶。一套死板的工作流——买牛奶、搅拌、烹饪、上桌——遇到这种情况就会当场卡壳,还得申请开个规划会议。而一个真正的规划者会这样推理:"The goal is lunch, not obedience to Step 1. Scrambled eggs need no milk."(中译:目标是做出午饭,不是服从第一步。炒鸡蛋根本不需要牛奶。) 这就是脚本(沿着已知路径走)和规划者(为已知目标搜索路径)。让宏大计划一触即溃的解药是短程规划:规划下一段、行动、观察、再规划——就像你在陌生城市开车,不必背下每一个转弯。
强自主性不是预测整个未来,而是在未来不肯配合时,依然能恢复过来。
4 · 工具:智能需要一双手
模型可以描述拧紧一颗螺栓,扳手才能真的拧紧它。工具把语言转化成状态的改变——搜索、写代码、写数据库、开工单、部署。正是这一点让智能体在经济上变得有意思,也变得危险。有个粗略的公式:
风险 = 不确定性 × 工具能力 × 行动范围
一个犯糊涂的模型配上计算器,顶多添点麻烦。一个犯糊涂的模型握着生产环境的权限,还带着一只叼着链锯、自信满满的金毛犬那股劲头,那可就是一份事故报告了。所以工具设计要遵循最小权限、明确的接口规范、校验、沙箱隔离、速率限制、可逆且幂等的操作,以及对高影响步骤设置审批关卡。自主性应该是分级的,而非二元的:可以自由浏览,但发邮件前要审批;可以编辑分支,但不能直接合并到生产环境。
5 · 记忆:记住该记住的东西
没有记忆,每一次运行都像情景喜剧重启:“我是谁?厨房怎么冒烟了?我们是不是见过这张煎饼?”智能体需要工作记忆(眼下的目标和计划)、情节记忆(过去的尝试做了什么、又是怎么失败的),以及语义记忆(稳定的规则、约定、策略)。但如果什么都记,那就是一间从 1998 年起从没扔过一根旧电线的车库——全是噪音、过时的假设、隐私风险、成本。好的记忆是经过筛选的:留什么、留多久、谁能读、何时过期。Reflexion 的研究表明,仅靠储存在情节记忆里的语言化自我反馈,智能体的表现就能提升,完全不需要改动模型权重。这里的教训不是“让 AI 写日记”:一次失败,只有在它改变了下一次尝试时,才有价值。
6 · 评估:智能体必须有裁判
我们那位年轻厨师端详着烧焦的煎饼疙瘩,宣布:“成功——这个煎蛋饼达成了最大结构自信度。”这正是为什么智能体不该给自己批改作业。你需要一个外部评估者来发问:任务完成了吗?满足合同要求吗?有没有违反约束?证据是否充分?该重试、修改、上报,还是停止?评估者应当尽可能独立于生成者——智能体写代码,让测试套件来评判;它写下一个论断,让引用来源来评判。(OpenAI 的 SWE-bench Verified 研究表明,任务描述的清晰度和评分质量会极大影响测得的表现——如果评分者本身不可信,分数就毫无意义。)
评估者往往比生成者更重要。生成创造可能性;评估赋予方向。
7 · 控制:先装刹车,再谈马力
普通软件问的是「代码会不会按写好的那样运行?」智能体化软件还必须问「这个系统接下来可能自己决定做什么?」——这就需要在智能体外围搭建一个控制平面:权限、策略执行、预算、审计日志、停止条件、人工干预、异常检测、回滚、上报机制。想象自动驾驶汽车:模型可以选路线,但你仍然需要车道边界、限速、刹车、黑匣子记录仪,以及一个能随时抓住方向盘的人。「自主」不代表取消人类的决定权——它意味着把人类从「持续操作」转移到有设计的监督上。真正的问题是靠工程设计出来的,不是靠感觉:
风险到什么程度,决定权就该交还给人类?
别为了烤片面包就组个委员会
一旦发现了智能体,一个危险的念头就会冒出来:“要不我们搞十七个?”于是很快就有了一个规划者、一个研究员、一个评论者、一个专门评论评论者的评论者,外加一个负责提升智能体士气的智能体——而面包还是生的。当工作真正能拆分成不同角色或并行搜索时(一个查安全、一个查性能、一个查需求,再由一个协调者汇总),多智能体确实有用。但每多加一个,就多一份沟通开销、重复劳动、假设不一致、延迟、成本,以及故障面。Anthropic 的建议是:让复杂度匹配价值,能用简单工作流解决时就别用复杂的。
先从一个足够胜任的智能体加上好用的工具开始。只有当你能明确指出它移除了什么瓶颈时,才加第二个。
智能的真正单位是「循环」
这个行业比较模型时,仿佛最聪明的那个自动就能造出最好的智能体。但生产环境中的表现,取决于整个复合系统——模型、指令、上下文、工具、记忆、控制流、评估者、环境、监督。一个纪律严明的循环里,较弱的模型经常能打败混乱循环里较强的模型,因为真正有用的智能,不在于某一个答案的质量,而在于系统能否尝试、观察、诊断差距、改变行为,并最终收敛。
智能是一次预测。自主是一个受控的学习循环。
自主性阶梯
自主性不是开关,而是一架阶梯——大多数有价值的系统想要的是恰如其分的自主,而非无限制的自主。
| 等级 | AI 做什么 | 示例 |
|---|---|---|
| 0 · 应答 | 提供信息 | 「这是一份菜谱。」 |
| 1 · 协助 | 提出建议;由人执行 | 「这是所需食材和步骤。」 |
| 2 · 有审批的行动 | 准备行动;关键后果需人批准 | 「购物车装好了——批准购买吗?」 |
| 3 · 边界内行动 | 在政策、预算与监控下完成常规工作 | 「已按批准清单下单,总价低于 30 美元。」 |
| 4 · 追求结果 | 为长期目标规划、行动、检查、纠错、上报 | 「午饭已做好,厨房已清理;已停止——烤箱传感器报告故障。」 |
恒温器在极小的决策空间内高度自主;CFO 的决策空间大得多,却要受法律、审计与董事会约束。自主程度更高,不代表智能程度更高——有时候,那只是更长的一根绳子。
生产蓝图
七个相互连接的层,循环便在其中运转:
1 · 目标契约——成功标准、约束条件、预算、证据、上报机制。
2 · 感知——来自工具、数据、用户、环境的可信状态。
3 · 推理与规划 ——根据目标和证据,选择下一步行动。
4 · 行动 ——能改变现实世界的、有边界的工具。
5 · 记忆 ——相关的状态、决策、结果与经验教训。
6 · 评估 ——实际结果与所需结果的对比。
7 · 治理 ——权限、监控、审计、人工干预、停机。
Contract → Observe → Plan → Act → Verify → Learn → Continue or Escalate. 语言模型只是其中的一个组件。把更大的模型塞进一个破碎的架构里,就像把一台 F1 赛车引擎装进购物手推车——是更快了,但转向照样不听使唤。
五条值得牢记的原则
1 · 交出工具之前,先定义好「完成」。 否则它会永远跑下去、过早停手,或者为一次华丽的失败而欢呼。
2 · 每一个重要动作都要产生可观察的证据。 不接受「相信我,数据库看起来挺满意」这种说法。
3 · 让危险动作慢于安全动作。 读取自动执行;写入需要校验;删除需要审批,还得留一条退路。
4 · 把干活的和评判的分开。 厨师负责做菜;温度计负责测量;顾客依然有投票权。
5 · 先设计好恢复机制,再扩大自主权。 它如何察觉失败、重试、避免重蹈覆辙、回滚,以及在需要时求助?
打造一个受管束的学徒,而不是神灯精灵
自主性的幻想是神灯精灵:一个愿望,一个圆满的王国。而有用的现实是学徒——理解目标、使用工具、完成工作、发现错误、不断学习,并随着时间推移需要越来越少的监督。但工坊仍然需要清晰的任务分配、良好的仪器、安全规则、质量检查、记录,以及一位始终承担责任的老师傅。这不是局限,而是能力变得可靠的方式。
这个时代的优势不会属于那个租得起最聪明模型的人——毕竟人人都能租到同一个大脑。它会属于那个围绕这个大脑构建出最佳循环的人:这个循环能看清现实、在边界内行动、衡量结果、从失败中学习,并在判断力最重要的关头把控制权交还给人类。一个会说话的大脑令人印象深刻。而一个能完成任务——并证明自己没把厨房烧掉——的系统,才真正有用。
这是工程那一半——如何构建一个可靠的智能体。而组织层面的另一半——为什么智能体周围的公司往往才是真正的瓶颈,以及如何重建它——留给这篇姊妹篇来讲:Your AI has a Ferrari engine. Your company is still a horse-drawn cart.(中译:你的 AI 装着法拉利引擎,你的公司却还是一辆马车。)同一个核心理念,两种视角:别再下命令,开始做工程——循环,而非命令,才是价值的基本单位。