Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅列表
← 返回作品集

AI 原生系列 · 策略 OS

你的策略牌早就死了。我们让策略跑 CI。

一分钟带走的东西——你能收获什么

大多数策略死于一份策略牌:数字没有出处,预测装扮成事实,也没有机制能察觉世界已经变了。我们造了一套策略操作系统,让策略像代码一样过关——文档要跑一遍 make check、无凭据即沉默、每个决策都由人类把关——然后拿一次真实的企业级合作项目对它做了压力测试。6 项优点,7 项缺点,凭据齐全。

一套策略操作系统:每个数字都要有凭据,预测不能冒充事实,「就绪」是一道闸门,而不是一种感觉——在一次真实的企业级合作项目中做了压力测试,诚实打分:6 项优点,7 项缺点,还有 1 处我们在自己的设计里发现的规格缺陷。

Strategy, gated like code — make check: 26/26

《麦肯锡季刊》刚给这种焦虑定了个数:企业级 LLM 支出在十二个月内暴涨两倍,与此同时 token 价格却在崩跌,93% 的受访企业都超了 AI 预算,AI 支出正朝着企业 IT 总支出的四分之一逼近。他们那句断语——"tokens are not value; tokens are the bill"(中译:token 不是价值,token 只是账单)——其实是在说策略:多数组织根本说不清哪些投入在起作用、真实成本是多少、他们的路线图究竟建立在什么证据之上。

而我们用来管理这些投入的工具,居然还是……一份策略牌。策略牌是思维在信心最爆棚那一刻被冻结的快照,上面的数字没人说得清来路,也没有任何机制能在世界已经推翻它们时提醒你。你问一份策略牌「为什么这个就绪度打分是 3.2?什么情况下你会改变看法?」——得到的只有沉默。

于是我们造了一个替代方案,然后做了一件大多数人都会跳过的事:我们试着在一次真实项目里把它打碎,并且把成绩单公开发了出来。

第 0 阶段:在写下一行引擎代码之前,先交出二十份交付物

这个项目是一套策略操作系统——一个私有的元仓库,在这里,策略不是一份文档,而是一个可连接、可测试的对象:目的 → 证据 → 诊断 → 选项 → 决策 → 架构 → 执行 → 指标 → 适应,每一环都可供检查。

在写下任何引擎代码之前,我们先产出了二十份预实现产物——一份组合清单、一份横跨九大工具类别的行业景观报告、一张含 25+ 框架卡片的框架图谱、一套本体论、三个架构方案、七份决策记录、一份里程碑计划——而真正让它落地的是这一步:

我们给文档接上了 CI 流水线。一个失败即拦截(fail-closed)的闸门脚本会检查每一份产物:文件缺失、内容空洞、必需章节缺失——每一种失败都有名有姓。make check:26/26。而这道闸门唯一绝不会做的事,就是替人推断许可——人类的批准存在于一行「人类闸门」中Status:,只由人类编辑,原样转述。

支撑整套系统的是四条设计原则:

The strategy loop: evidence with receipts feeds diagnosis, options, a human decision, execution, and tripwires that feed back into evidence
取代战略牌局的这个循环是这样的:每个阶段都要消耗凭据,一旦假设过期,绊线机制就会把策略硬拽回现实。

压力测试:一次真实的、手工跑通的实战

规格写起来是廉价的。所以在动手搭建引擎之前,我们先把整套方法论手工跑了一遍,用在一次真实的、保密的企业项目上(细节必须保密——这恰恰证明保密规则在起作用)。带出处的证据登记册、可证伪的诊断、三个真正不同的选项、附带利益相关方反馈的权衡取舍、一份 90 天计划,一应俱全。

扛住的部分(6 个优点,仓库里都有凭据): 分类纪律发现某个来源其实是「摘要的摘要」,逼着我们诚实降级;诊断模式打回了第一版草稿,因为那不过是披着策略外衣的目标清单;当有人冒出「干脆把选定的策略直接写上去」的念头时,本体论说了不——那份决策文档上老老实实写着 Chosen Strategy: NONE,因为当时还没有人类做出决定。

崩掉的部分(7 个弱点,同一个仓库): 逐句手动分类是最慢、也最容易被跳过的一步——一旦不自动化,「溯源」就沦为表演;markdown 证据登记册没法在规模化场景下回答「如果这条假设失效了,还有什么会跟着动摇?」;而最扎心的一条是——这套方法论推荐了一个和它自身如出一辙的架构,却没有任何对抗性环节来挑战自己的先验假设。 我们把这个记为长期风险,并新增了一道强制性的红队环节。一个给万物打分的系统,自己也必须是可以被打分的。

浮现出一个真实的规格缺陷(本体论缺失一种我们需要的实体类型),登记册新增了两条风险,还有两个核心假设从「假设」升级为「部分获得证据支持」——连带推动它们升级的证据也一并记录在案。

这套心智模型,15 岁的孩子也能跑得动

策略本质上是一座「主张工厂」。每条主张都需要一张凭据。凭据一旦过期,策略必须自己察觉——不需要人提醒。 如果你的策略说不清楚「什么能让它改变主意」,那它就不是策略,只是一种披着格式外衣的情绪。

「智能体化经济学」这个角度让这件事变得紧迫,而不只是好看:McKinsey 自己的数据显示,智能体化的成本表现为一种分布——同一个任务的成本可以相差约 30 倍,而一个智能体化任务里大约 60% 的成本花在检查和修复上,而不是第一次给出答案。任何建立在单点估算式 ROI 之上的 AI 路线图,从结构上就是错的。分布、尾部成本,以及会被校准打分的预测——这些不是装点严谨的摆设,而是诚实所要求的最低限度。

接下来会怎样

目前仓库仍按设计保持私有。「实施闸门」——归人类所有,目前被诚实地标记为「未批准」——决定着规格何时能升级为引擎。一旦开启,第一个垂直切片将端到端跑通一个策略问题:证据进去,可审计的策略报告出来,每一个数字都能用一条完整的链条回答「为什么」。

过不了闸门的策略,本质上还是一份战略牌局。我们宁愿先把闸门造出来。


AI-Native 系列 · Paul Jialiang Wu · love12xfuture · 文中提及的这次合作项目内容保密;但关于系统本身的每一项主张,都可以在项目的闸门日志与账本中得到核实。