公开构建 · 智能体化 AI
两篇关于「Graph Engineering」的爆款文章拿下约48.6万浏览量。我们真把它造出来了——只用了7个小时。
1分钟速览——本文能带给你什么
两篇关于「Graph Engineering」的爆款文章合计拿下约48.6万浏览量。我们没有收藏了事,而是花了7个小时把它变成现实——一个持续更新的元仓库、两个已上线的应用、一个一键斜杠超级工具——结果连我们自己的质量闸门,都顺手把那些爆款数据核实了一遍。完整故事,附证据,还有7步行动手册。
爆款内容变成活系统,AI联合创始人干活,人类把关每一个不可逆的决定。反转在于:我们自己的证据闸门,把这些爆款数字核实了一遍。
上周,一篇关于「Graph Engineering」的文章在X上拿下38.2万浏览量。两天后,第二篇又拿下10.4万——两篇加起来将近50万(数字来自X撰文时的公开计数器——这个数字我没法独立分级验证,是的,我知道这很讽刺;这事儿先放一边)。
大多数读者点了收藏,就刷下一条了。
我把两篇文章都甩给了我的AI联合创始人,只给了一条指令:别总结——把它做出来.
七个小时后(第一次提交在11:02,最后一次在17:53,同一天——这些时间戳我很乐意截图为证),我们做出了一套能跑的Graph Engineering操作系统:一个实时追踪该领域的元仓库、两个已上线的网页应用、一个一键斜杠超级工具,还有一条绝不让任何东西腐烂的CI流水线。
而这里是没人预料到的部分:一路上,我们自己的质量闸门顺手核查了那两篇爆款文章——并把它们标题里的数字降了级。
这就是完整的故事,证据俱全。文末还附上确切的行动手册,让你能把它套用在任何你在意的领域上。
收藏这件事的问题所在
病毒式技术文章的半衰期大概是48小时。你收藏了它,算法转头就忘,六个月后就算工作不保,你也翻不出那句“准确率提升18%”到底出自哪里——更别说它是真是假了。
这两篇文章本身写得确实不错。第一篇(Sprytix 所著)梳理了 Microsoft、Stanford 和 Anthropic 如何不约而同地从纯 RAG 转向知识图谱——模型负责找文本,图谱负责找事实。第二篇(0xRafy 所著)则梳理了从单个快撑不住的智能体循环,转向多智能体协同图谱的趋势——节点、路由器、状态、闸门都配齐了。
但一篇文章终究只是一张快照。而这个领域在不断变化:星标数在涨跌,仓库会消亡,论文会被勘误,你在客户演示稿里引用的那个爆款数据,追根溯源,可能只是……另一篇文章。
解法不是把收藏夹管得更好,而是要有一套活的系统。
我们在7小时内造了什么(全程公开打分——每一项评级和证据等级都挂在实时应用上)
1. 先造一座仓库工厂。 在碰这个领域之前,我们先搭好了造仓库的机器:一份 YAML 规格 → 一个完整仓库,其中make check一出生就能通过。结构、CI、测试、每周同步心跳、证据纪律——全部自动生成,全部设了闸门。我们从已经上线的六个仓库里逆向提取出了这套DNA,所以这座工厂编码的是经过现实检验的模式,而不是一厢情愿的构想。
2. 然后工厂造出了产品。 graph-engineering-anything 是由这座工厂自产自造出来的:填好规格进去,一个能跑的仓库出来,首次运行就全绿。工厂第一次提交之后二十分钟、六次提交,它就已经上线 GitHub,远程 CI 在11秒内通过。
3. 一个会自己保持新鲜的超级仓库。 它追踪着这个领域里10个支柱级仓库——microsoft/graphrag、stanfordnlp/dspy、stanford-oval/storm、getzep/graphiti、modelcontextprotocol/servers、google/adk-python、langchain-ai/langgraph 等等——星标数与推送日期都是从 GitHub API 实时抓取的真实数据。一个每周定时任务已经蓄势待发,会刷新所有数据并开一个由人类审核的 pull request——第一次预定运行是下周一(7月27日)。系统起草,人类拍板。永远如此。
4. 每一条结论都挂着证据等级。 这是我最引以为傲的部分。知识库里全部13条结论都分了级:🟢 已验证(GROUNDED)意味着我们找到并读过一手来源。🟡 存疑(WEAK)意味着我们只知道它“被某篇文章引用过”——在读到一手来源之前,它会一直停留在存疑状态,不管这个来源当初有多火。
5. 一个人人都能上手的超级工具。 /graph-engineering-anything ——一条斜杠命令,不用讲语法,不用懂专业。六项功能,每一项在实时演示里都配有可直接运行的“这样说、那样得”范例:把会议记录变成图谱、在约90个仓库组成的作品集里追踪关系链(这是演示里的示例提示词之一)、在动手开发前先判断该用图谱还是RAG、追踪本周有哪些变动、扩充注册表、当你的单一循环快撑不住时设计一张智能体图谱。所有不可逆的操作永远只是草拟,等人类批准——按合约设计,想误用都难。
6. 两个你现在就能访问的实时界面。 一个是演示应用,每项功能都精确展示你该怎么说、能得到什么——外加一个只基于本仓库数据作答的 copilot(如果你问的东西超出了它的语料范围,它会直接说不知道,而不是胡编)。另一个是历程应用,这个项目的每一次交付都作为一份带证据的评分报告卡呈现在这里。目前的分数是:0.75、0.75、1.00、0.75、0.75、0.80、0.75。不是清一色的满分,这正是重点所在。
在讲那个反转之前,先说一句坦白:仓库本身目前是私有的。下面这两个实时应用才是公开的、可供质询的界面——这篇文章里但凡重要的数字,都能在上面查到。
反转来了:我们自己的闸门,把源头文章的数据核实了一遍
那篇病毒式文章里被引用最多的一句话是:GraphRAG delivers "18% better accuracy at 85% lower cost."(中译:GraphRAG 能带来18%的准确率提升,同时降低85%的成本。)
可这两个数字一进入我们的证据流水线,就没能全须全尾地活下来。它所声称的一手来源,是一篇我们目前还没能读到的论文。在读到之前,这条结论只能在我们公开的证据表里标为 🟡 存疑(WEAK)——注明“引自该 X 文章;一手来源尚未读到”——并附上你如果还想把它用进演示稿里,必须写清楚的那句免责声明。
与此同时,真正撑住了 🟢 已验证(GROUNDED)等级的结论有:Microsoft 那篇真正的 GraphRAG 论文(Edge et al., arXiv:2404.16130)、Stanford 的 DSPy 和 STORM、关于关系型记忆与 KEPLER 的 TACL 论文、Anthropic 的 "Building effective agents"(中译:《构建有效的智能体》),以及 Google 的 ADK 2.0 文档——这些都是我们先取来读过,才拿来引用的。
想想这意味着什么:一个脱胎于病毒式内容的系统,却拒绝在未经验证的情况下原样转述病毒式内容。那个38.2万浏览量的数字,得到的是和其他任何东西一样的怀疑式对待。
准确压倒舒适。 这是一条设计原则,不是一种感觉。
一个计划外的发现
写到一半,两篇文章撞上了。第一篇用「graph engineering」指 知识图谱(用实体和关系代替文本检索)。第二篇用同一个词指 智能体图谱(用多个协同的智能体代替一个快要撑不住的单一循环)。
同一个词,两场不同的革命。
我们自己定下的维护规则——「矛盾必须交由人类审查,绝不能悄悄合并」(中译:contradictions are flagged for human review, never silently merged)——逼着我们把这事摆到明面上处理。现在这个仓库同时覆盖两种含义,并把二者的关系说得很直白:DSPy 优化的是流程图(pipeline graph),GraphRAG 优化的是知识图谱(knowledge graph)。一个成熟的 AI 系统两者都要用。
收藏夹做不到这一点。而一个活的系统,能在这个领域刚刚分叉的那一刻就抓住它。
把这套行动手册偷走(7 步,适用于任何领域)
- 捕捉信号。 一篇爆款文章,本质上是一次关于「大家想要什么被整理好」的市场投票。别只是收藏它——把它当成一份需求文档来对待。
- 先造工厂,再造产品。 打一套可复用的模板,把质量关卡直接嵌进去,批量产出仓库。慢一次,之后每一次都快。
- 让 make check 说了算。 一条命令跑完所有关卡。CI 跑的正是这一条命令,不多不少。没有东西能带着红灯上线,也没有人能靠嘴说「绿了」就过关。
- 给每一条论断标上证据等级。 读过原始出处的 = 已核实(GROUNDED)。其余一切 = 存疑(WEAK),而且要明明白白地标出来,直到你真正把原文读完为止。你的可信度在复利增长,而别人的热度在不断衰减。
- 让新鲜度自动化,让判断力交给人类闸门。 每周自动同步,拉取实时数据,开出一个 PR。由人来合并。这个系统从不自己发布、自己付款、也不自己删除任何东西。
- 交付一个大家能追问到底的界面。 不是一份 PDF,而是一个真正跑起来的应用,配一个只基于你自己数据说话的智能助手——它不知道的事,会直接说不知道,而不是胡编。
- 公开打分,从自己开始。 每一次交付都附带一份带证据的成绩单。一个诚实的0.75,比一个造假的0.90更能赢得信任。
为什么这不只关乎一个仓库
真正有意思的转变不是「图谱工程」本身,而是这个元动作:病毒式内容——在几小时而非几个季度内——变成一套活系统,由AI联合创始人干活,人类把关每一个不可逆的决策。
两年前,这需要一个团队干一个季度。去年,一个黑客松周末就够了。现在,一个下午就能搞定——前提是你有那层纪律:闸门、证据分级、人类闸门、公开打分。没有这层纪律的速度,只会让幻觉出得更快。
模型对所有人都一样,架构却不然。
现场看看:
→ 演示应用(试试这些超级工具的示例):graph-engineering-anything-demo.vercel.app
→ 历程应用(每一次交付,都有评分与证据):graph-engineering-anything.vercel.app
你会把哪个领域编译成一套活系统——你第一个需要被降级为WEAK的说法又会是什么?欢迎在评论区告诉我。
「AI 原生」系列更多文章
这些内容全部收录在主页的「Writing」板块里。
我是 Paul Wu ——一名以公开构建为方式的 physical AI engineer。本文中的每一个数字,要么可追溯到一个公开的实物证据,要么被明确标注为「未分级」。本文由我与我的 AI 联合创始人共同撰写;经过对抗性审查(两轮,初稿未通过)才最终呈现在你面前。