Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語 ✉️ 免费订阅列表
← 返回作品集

2019 年,我造出了公司的大脑,却把它当成了一份待办清单

一分钟速览——你能带走什么

一家实体 AI 公司应该在每一个决策周期,重新求解「下一步最佳行动」,从而在所有部门间分配资源——这正是其机器人所用的那套 MPC 循环。我在 2019 年把这套引擎做成了 Life GPS(一个二元整数线性规划),却把它误当成了一份待办清单。

一家实体 AI 公司该如何在软件、硬件、前沿研发、市场、销售与制造之间分配资源——办法是每个周期都重新求解一次「下一步最佳行动」,就像它的机器人重新规划路径那样。

The company GPS: re-solve the best next move every time the map changes.
公司的 GPS:地图一变,就重新求解一次下一步最佳行动。

有一个问题,每位创始人、每位 CEO 私下里都答不好:

我们有软件、硬件、前沿研发、市场、销售和制造。钱只有一笔,工程师工时也只有一份。那么下一块钱和下一个小时,该投向哪里?

大多数公司的答案,和原始人处理一切问题的方式如出一辙:谁嗓门大谁说了算。硅谷甚至给这套逻辑起了个名字——HiPPO,也就是「工资最高者的意见」(Highest-Paid Person's Opinion)。 谁的故事讲得漂亮,谁就能拿到招聘名额。这不叫战略,这叫即兴表演。

我想给你看看真正的答案——然后坦白一件事:六年前我其实已经把它造出来了,只是当时没看懂自己手里握着什么。

第一个陷阱:「我们该走深,还是走宽?」

每次我把这个资源分配问题抛给工程师,他们脑子里冒出来的都是同一张图:一棵树。是该走深度优先——在一个分支上死磕到底,直到跑出结果——还是走广度优先——每个分支都推进一点点? 深度优先 vs 广度优先,DFS vs BFS。听起来很有道理。

但这是个陷阱,而且值得说清楚为什么,因为这个错误本身很有启发性。

图遍历回答的问题是:「我该按什么顺序访问每个节点?」——而且每个节点只访问一次。 但分配预算不是访问节点。你不是去「访问」一下销售团队;你是往里面灌注一份可分割、有上限的资源,然后看它能带来什么回报。深度优先和广度优先其实是同一台机器,只是把旋钮硬生生扭到了两个笨拙的极端:DFS 是「永远选最新的分支」,BFS 是「永远选最老的分支」。两者都忽略了唯一重要的事——此刻到底哪个分支最值钱。

所以,诚实的修正是——我很乐意在这里推翻自己先前的框架——答案从来都不是遍历顺序,而是目标函数与约束条件。 真正的工具不是图搜索,而是优化。 而这是一类已有 70 年历史、听起来无聊、早被解决的问题。你只需认出:你的公司正是这类问题的一个实例。

自白:我在 2019 年就造出了它,还叫它「Life GPS」

六年前我快撑不住了——要学的东西太多,能用的时间太少,任何一份排得死死的周计划到周三就崩了。于是我做了个小应用来拯救我自己。我给它取名叫Life GPS,卖点很简单:一个规划器,无论你错过多少个转弯,都能告诉你下一步最该做什么——就像 GPS 一样。

想先看全局?这里有发在 Medium 上的原始文章。想亲自体验一下,而不只是读读文字?六年后的今天,你依然可以去这个在线应用里点一点——设几个目标,点下「Update My Plan」,看着它重新求解。(代码放在 GitHub 上.)

在这个可爱的界面之下,藏着一个二元整数线性规划。 说白了:它把你的一周切成一格一格的「小时格子」,然后为每个任务把每一格开或关,目的是让真正重要的事情尽可能多地完成,同时遵守硬性规则——每个任务有最低小时数也有上限、同一时间只能做一件事、不能排到截止日期之后。求解器会找出一种最优的填格方式。就这么简单,这就是整个大脑——把「小时格子」换成「工程师工时和美元」,它就是一家公司:

maximize    Σ  value(department) × resource(department)   # the best next move
subject to  each team-hour spent only once                # no double-booking
            each effort ≥ floor,  ≤ cap                    # min viable, don't over-invest
            respect dependencies + deadlines               # the graph
then RE-SOLVE every cycle as reality reports back          # ← the GPS reroute (MPC)

最后这一行才是真正的关窍。前面的一切都只是一份计划;正是这一行,让它变成一份活的计划。

接下来这段,至今想起来还是会起鸡皮疙瘩。当你告诉它实际上发生了什么——「我今天早上只做了 40 分钟深度工作,不是两小时」——然后点击Update My Plan,它会做一件很具体的事:把过去冻结,从每一项剩余预算里减去你已经花掉的部分,然后把这周剩下的时间全部重新求解一遍。

这在机器人学里有个名字,叫Model Predictive Control(模型预测控制)——计划、执行、观察现实的变化、再从你实际所处的位置重新规划。 这正是自动驾驶机器人在走廊里突然出现一个箱子时,用来重新规划路径的那套控制律。 我在一个周末写出了组织级 MPC,却把它当成了一个效率工具。

那份旧代码里甚至还留着一个「幽灵」:一个我因为搞不定而注释掉的功能。一条规则本该是「这件事至少做 3 天,但不超过 5 天」——这是我笨拙地想去编码 DFS 与 BFS 之争背后真正的张力:专注与多样之间的取舍。 我 2019 年写的求解器在这条规则上直接卡死(因为它是个非线性约束)。放到今天,随便一个现代求解器都能轻松吃下它。当年我放弃的那个功能,现在只需要一行代码。

它为什么一直只是个玩具——而这恰恰就是全部机会所在

Life GPS 本身是正确的正确的。 它却始终没能走出我的笔记本电脑,原因只有一个:三样东西都得靠人手动敲进去,缺一样它就转不动。

The three starved feeds: what a human hand-cranked in 2019, an AI company now supplies automatically.
三条数据流:2019 年靠人手摇,如今 AI 公司自动供给。
  1. 权重。 我当时手打「学习 = 10,玩耍 = 6」——纯凭直觉。放到公司里,这些数字没人能达成一致,却决定着一切。
  2. 任务与规则。 手动敲进一张表格。繁琐、静态,永远过时。
  3. 反馈。 我得一天两次给自己打分。太烦了,后来就放弃了。

这三样东西,每一样都得靠人工手摇。 而这三样,恰恰就是 AI 原生公司现在能自动完成的:

这就是整个论点,一句话说完:Life GPS 曾是一个正确答案,却缺了三条数据源;而在 AI 原生时代,这三条数据全都免费奉上。 想法本身并没有变聪明,是传感器变便宜了一千倍。

写给机器人公司的点睛之笔

有一句话我一直挥之不去:

A physical-AI company should steer itself with the same algorithm its robots use to steer through the world.(中译:一家实体 AI 公司,理应用它自家机器人穿越世界所用的同一套算法,来驾驭自己。)

你的机器人不会算出一个完美方案就闭眼往前冲。它们感知、规划几步、行动、再感知、再重新规划——永不停歇。 而这家公司凌驾于机器人之上,也理应用同样的方式,来分配自己的钱和人。 不该是一月定死、三月就作废的年度计划,而是一个活的 GPS:每个周期都给管理层交出当下最优的下一步——一旦某道闸门失守、市场突变,或是一次关键招聘到位,它立刻重新规划路线。

The control loop: sense, solve for the best next move, act, re-plan — the same receding-horizon loop a robot runs.
控制回路:感知、求解出最优的下一步、行动、再规划——和机器人所用的那套「滚动时域」回路一模一样。

「媒介即信息」(麦克卢汉语)。如果你笃信闭环控制,愿意把它装进机器人里,那也该把它装进你的公司里。

这真正解决的是什么(那个更大的问题)

退后一步看,这个小点子指向一个大问题。「下一块钱该花在哪」,和机器人规划路径、基金平衡投资组合、AI 做「探索还是利用」的决策,本质上是同一套数学——它们是同一个问题:在不确定性下分配稀缺资源以实现价值最大化——而如今我们第一次能够在公司规模上真正跑起来这套算法,因为过去必须由人来供给的那三条数据源,现在都已自动化。

但有一点我不打算回避: 一切都押在权重上。 给优化器喂垃圾估算值,它会带着你冲下悬崖,还附带一张「最优性证书」——自信满满地错,比大致靠谱地对更糟。所以诚实的第一步不是搭引擎,而是先证明这些估算值是可信的——找六个过去的决策,让 AI 只用当时能知道的信息去估价,看看这套数学是否会选中后来真正奏效的那个。一个下午就够了。它要么证明整套系统站得住脚,要么告诉你真正的产品其实是这个估算器本身。这不是绕路,这就是纪律。

2019 年,我搭了一个 GPS 来把自己的一周管起来。后来才发现,我搭的其实是一家公司用来把自己管起来的东西。我只是得等这个世界追上这段代码。

你的下一块钱花去了哪里——你的公司能不能用一个诚实的数字来回答,而不是靠一个嗓门最大的人?


本文是「打造一家 AI 原生的物理 AI 公司」系列的一篇——前有《Ship a loop, not a demo》和《You Can't Order People to Close Loops》。发布于我自己的网站;背后的战略方案与代码放在一起。2019 年的种子代码:github.com/wjlgatech/life_GPS.