Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅清单
← 返回作品集

AI 原生系列 · 信任工程

文章提出了预言账本,代码十七分钟后就上线了。

作者:Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app · 2026-08-02

一分钟速览——读完你能带走什么

提出基建方案的文章通常都以「应该有人把这个做出来」收尾。而这一次,在「预言账本」那篇文章合并的十七分钟后,OEC 完整性链就已经合并进了 kingdom-come 的主分支——一个真实、开源的神学院平台——化作约 330 行代码、10 个 API 路由,以及一套测试名称本身就是这篇文章思想实验的测试套件:婚礼矛盾、无法证伪的话语、延迟时钟、过期的背书。教训不是速度,是体裁。一份能跑通测试套件的提案,是另一种性质的承诺——而智能体化工程,刚刚让这种承诺变成了默认选项。

这是完整性技术栈故事的第二部分:从论证到git push,同一个下午完成。约 7 分钟阅读。

Two panels seventeen minutes apart: at 17:36 an essay card proposing the OEC stack (Observability, Eval, Control) with the caption 'someone should build this'; at 17:53 a dark terminal card from kingdom-come listing four passing tests — test_wedding_contradiction_fires_same_day, test_unfalsifiable_word_grades_not_… (name truncated in the image), test_latency_to_correction_is_computable, test_endorsement_expires_and_reverifies — and the footer kingdom-come, 12 tests, make check 227
17:36 论证合并 · 17:53 实现合并。「应该有人做」和「已经做了」之间的差距,如今用分钟计算。

上一篇文章 提出了一个主张:像可信的系统对待任何有后果的输出一样,去对待公开的属灵宣告——可观测性 (宣告仅可追加、哈希链式的提交), 评估 (声明式判定标准、三档诚实评级、矛盾与延迟检测), 控制 (一道平台闸门,其后果与计分卡挂钩)。和这类文章一样,它最后也附上了一张架构图。

这类文章都有一种失败模式,我自己在文中就点明过:"policy without observability is a sermon about logging."「中译:没有可观测性的政策,只是一场关于日志记录的布道。」同一把剃刀,也照样削向我自己: 没有实现的提案,只是一场关于闸门的布道。 于是就有了这第二篇——它之所以存在,是因为这篇文章的后续不是一个讨论帖,而是一次提交。

心智模型:可执行的提案。 在旧有的建造经济学里,写文章和做实现是两个不同的项目——文章只要一天,代码却要一个季度,于是世界上堆满了文章。智能体化工程把这道差距压平了:写出论证的那个下午,也写出了约 330 行代码、10 个 API 路由,以及在真实平台主分支上的 12 个测试。当实现变得这么便宜,「某人应该把这做出来」就不再是一句结论,而变成了一句自白。

载体:一个早已在为「先知话语」称重的平台

这些代码,可不是落在某个玩具仓库里。 kingdom-come 是一个开源的神学院培育平台(FastAPI、实时演示、200+ 项测试),其中已经有一样了不起的东西: 牧养祷告与预言账本,其中每一句先知话语,都由三位指定「称重人」中的两位来裁定通过与否——把《哥林多前书》14:29 逐字实现为一台状态机——随后追踪其应验情况,并要求提供见证。文章提案中「牧养」的那一半,早在文章写成之前就已经存在。

它所缺的,是「完整性」那一半:牧养账本记录下的,是群体 所决定的结果,但没有任何机制能保证记录本身不会被悄悄改写,没有要求宣告必须具备可证伪性,更没有把后果和过往记录绑定在一起。这恰恰就是 2026 年那起事件暴露出的三个漏洞。于是,新的模块——backend/services/integrity.py ——就安放在牧养账本旁边,把这三个漏洞一并补上。

代码强制的,而非建议的

A five-row table mapping documented situations from the 2026 case to named tests in kingdom-come's suite: the wedding contradiction to test_wedding_contradiction_fires_same_day, the vague word to test_unfalsifiable_word_grades_not_measurable_only, the late apology to test_latency_to_correction_is_computable, the 20-year platform to test_endorsement_expires_and_reverifies, and the mother's objection to test_dissent_is_logged_beside_the_claim — all marked passing
思想实验,变成可执行代码:案例中记录在案的每一种情形,如今都是一条有名有姓、能跑通的测试。

测试套件,就是那个思想实验

第一部分以一个思想实验收尾:老老实实地把这桩记录在案的事件,重放一遍这整套系统。到了第二部分,这次重放不再是文字叙述——而是tests/test_integrity.py,重点就在这些名字本身。以下逐字摘自测试套件,任何人都可以在公开仓库里读到 [1]:

这个模块共有十二项测试;平台的完整闸门—— make check ——在发布这个模块的那次提交上通过了227项测试 [1]。其中有一项测试值得单独成句,因为整套设计最终都要向它交代: test_gate_passes_a_clean_speaker。一位诚实的讲道者,说出一句可衡量的话,如实兑现,便畅通无阻。这套体系不会让诚实的牧者付出任何代价——这一点本身,恰恰说明代价从来都不是重点。

当天上线,证明了什么,又没证明什么

说句实话,关于那十七分钟:代码是与文章的最终审阅同步完成的,出自撰写文章的同一套「人类+智能体」工作流——这个数字衡量的,只是两次 合并操作,而不是什么超自然的打字速度。而且,主分支上的 v1 版本也并不等于一套已经落地的制度:哈希链目前是内存实现,持久化留待后续(文档中已注明);矛盾检测是结构性的(比对声明的主题与立场),而非语义层面的——模块的文档字符串已经明白写出这一点,不让读者误以为背后有什么 NLP 魔法;至于第一部分提到的采纳难题,再多代码也无济于事,因为最需要账本的那些领导者,恰恰不会自愿套上它。平台,依然是那个可以撬动一切的支点。

它真正证明的,范围更窄,但我认为也更有用: 借口清单变短了。 「总得有人把这个做出来」,现在有了一个带 commit hash 的回答。当一篇文章的提案能够在真实平台的主分支上运行、通过测试,甚至早于这篇文章的推广素材被点击发布之前,那么无论是教会的标准文档,还是任何人的标准文档,诚实的问题就不再是「这是不是个好主意」,而变成了「它凭什么还只是一份 PDF」。

好做法 / 坏做法

机制,命名如下: 可执行的提案——当智能体化工程把「论证」与「构建」之间的成本差距压缩掉之后,实现本身,就成了检验论证是否真诚的试金石。

第一性原理,一句话说完: 如果你提议一道闸门,就把这道闸门做出来——没有落地的标准,只是一篇关于记录日志的布道词,而如今,会众可以自己去查提交记录。

出处说明——哪些已核实,哪些只是说法

本文引用的全部代码与测试名称,均可在 kingdom-come 公开仓库的以下提交中核实——commit 1c5869f [1],包括源码内那条规则:"a word that can never be false can never be counted true."(中译:「永远不可能为假的话,也永远不能被算作真。」)227 个测试全部通过——这一数字来自我自己跑的一次 make check 运行结果,记录在该仓库的成绩单里(编号 rc0001,位于其 docs/reportcards/collection.json)。十七分钟的间隔,指的是我自己仓库日志里两次合并(merge)的时间戳之差——kingdom-come 那一份是公开的,portfolio 那一份是私有的,所以这个数字只能算是我本人的报告,读者可以对照这两份材料的发布时间,大致核验其可信度。2026 年那起案例,第一部分已经按照完整的出处规范做了交代。

参考资料

  1. wjlgatech/kingdom-come(公开仓库)—— backend/services/integrity.py · tests/test_integrity.py · commit 1c5869f, 2026-08-02.
  2. Wu, P. J. (2026)。凡事察验,善美的要持守——如今,我们有了工具。 第一部分——案例、古老的规范、OEC 设计。 agentic-portfolio-lovat.vercel.app/articles/prophetic-integrity-stack.html
  3. Shekinah Worship Center(2026)。 《关于 Sadhu Sundar Selvaraj 的声明》 ——测试用例命名所依据的原始案例;引文已在第一部分核实。 shekinahworship.com
  4. 经文: 《新国际版圣经》(NIV)——哥林多前书 14:29("Two or three prophets should speak, and the others should weigh carefully what is said"(中译:至于说预言的,只好两个人,或是三个人,其余的人应当分辨)),已对照 biblegateway.com 核实;在 kingdom-come 中实现为「2 of 3」权衡规则。

相关文章

写于代码上线当天,依据公开仓库、通过的测试套件,以及第一部分核实过的案例档案。——Paul Jialiang Wu · agentic-portfolio-lovat.vercel.app