Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅
← 返回作品集

AI 原生系列 · 08

83% 的智能体和 24% 的智能体,是同一个模型

1 分钟带走的要点

Snowflake Summit 2026 的头条数据:同一个模型单独作战时得分 24%,接入受治理的上下文后得分 83%。你的 AI 智能体不是笨,是没吃饱上下文。逐条拆解这套「上岗」心智模型。

你的 AI 智能体不是笨,是没吃饱上下文。这是智能体化企业的「上岗」心智模型,逐条对应到真正落地的产品。约 8 分钟读完。

The same model at 24% alone and at 83% wrapped in identity, memory, and audit rings
同一个大脑,两个分数。差别全在它外面裹着的那层东西。(有动画——耐心等一秒。)

一个从两万人大会上走出来的数字

今年六月 Snowflake 的 Summit 大会发布了 26 项以上新能力,背后只有一个论点:智能体化企业靠的是受治理的上下文,而不只是算力。大多数发布会内容都会像往常一样在记忆里模糊成一团。唯独这一个数字不该被遗忘。

接入企业记忆层——由查询历史、元数据和仪表盘自动构建而成——之后,智能体回答业务问题的准确率据称达 83% 的准确率;没有它,只有 24%。 同样的模型,同样的数据仓库,唯一的变量,是有没有人告诉这个智能体,这家公司 到底是怎么定义它的世界的。

这一点,足以让你重新排一下优先级。当智能体表现不佳时,行业的默认反应是换模型——等下一个版本发布,或者付钱升级到更贵的档位。但这个数字说明,这种反应恰恰搞反了方向:模型从来都不是瓶颈。上岗才是。

心智模型:史上最聪明的新人,第一天上班

整套想法其实很简单,简单到都不需要一个缩写词:

一个加入你公司的前沿模型,是史上最聪明的新人——第一天上班,公司却没给它工牌,没给它员工手册,也没派主管带它。

让这位新人给你算一下第三季度营收,他会自信地给出四个数字。全部真实,但四个都不一样。这不是因为他笨——而是因为「营收」在你公司的不同系统里有四种不同的含义,而没有人告诉他哪一个才是唯一正确的那个。他没法刷卡进入存放优质数据的房间,只能就地取材、临场发挥。而由于没人复核他的工作,你要等到生产环境出问题时,才会发现他是在临场发挥。

Day-one genius versus the same hire onboarded
没有人会因此断定这位第一天上班的天才很笨。他们只会断定:上岗手续还没办完。

当一位人类天才在第一周表现不佳时,没有哪个经理会说「我们需要一个更聪明的天才」。他们会说:给他发工牌,把员工手册递过去,告诉他谁负责什么,然后一直复核他的工作,直到信任建立起来。这——正是这个,没有更玄乎的——就是智能体化企业这套体系的真相。

逐项对照:这套上岗工具包,如今已是真实产品

一个经不起真实产品手册检验的心智模型,只是装饰品。所以这里是对照表——右边每一行,都是今年已经作为平台原语正式发布的能力:

Onboarding terms mapped to platform primitives
左栏给直觉,右栏给架构评审。

工牌 = 智能体身份。 迄今为止最有分量的一项发布,其实不是模型: AI Agent Identity 已经正式发布(GA)——每个智能体都获得加密身份、按智能体分配的 RBAC 权限,以及完整的审计轨迹。智能体现在是一个主体,不再是借用某个团队服务账号跑起来的脚本——这在安全上,等同于把你的万能钥匙和你的名声都借给了实习生。

员工手册 = 上下文层。企业记忆层(Cortex Sense)从组织的实际行为——查询记录、仪表盘、元数据——中学习这个组织如何定义自己的业务。这正是 24→83 的杠杆所在。语义模型在 text-to-SQL 场景中做的是同一件事:准确率问题从来不是「模型会不会写 SQL」,而是「模型知不知道你那四个营收数字里哪个才是真的」。

组织架构图 = 数据血缘。现在,受治理的数据目录也会从数据仓库之外抓取元数据——Postgres、Tableau、dbt——并提供列级血缘追踪。这背后强制执行的规则,是每个数据科学家早已认同的一条:没有血缘的答案,就是谣言。

试用期 = 评测、审计与人类闸门。每一次操作都被记录,质量对照一条标准去衡量,只有证据支持时才扩大自主权。信任是靠被审查过的工作挣来的——对人如此,如今,结构性地,对智能体也是如此。

三副望远镜,因为一个火热的数字撑不起一套架构

在把整条路线图押注在「情境就是杠杆」这件事上之前,先用三种缩放尺度检验它。

Three telescopes: 30 days, 30 years, 500 years
新鲜的信号、存活下来的信号、古老的法则——三者指向同一个方向。

30 天(够不够热?)。一场峰会,26 项以上新能力,一个统一的论点;一笔约 2 亿美元的合作,用来让前沿模型在数据边界内部运行,而不是把数据搬出去喂给它们。还有那条 83 比 24 的头条数字。诚实税——毕竟诚实正是这里的品牌:这个数字是vendor-reported at a vendor conference(中译:由供应商在供应商自办的大会上公布)——证据等级:claimed(中译:据称),未经独立复现验证。我把它当作一个方向来看待,而不是一个恒定的常数。这个方向依然精彩。

30 年(它撑过去了吗?)。数据领域里每一个长期赢家走的都是同一步棋:把工作挪得离受治理的数据更近。数据仓库把计算挪到了数据身边。知识图谱(“things, not strings”,2012 年提出)把含义挪得更近,并且活过了自己的炒作周期。特征仓库(feature store)把机器学习里的定义挪得更近——一个定义,两方消费,训练与线上服务之间的偏差不再靠英雄式救火解决,而是靠契约本身消灭。这段历史里,模型年年在换;围绕它们的结构却在持续复利积累。

500 年(它算不算古老的法则?)。1494 年,Luca Pacioli 把复式记账法系统化成文。这并没有让威尼斯商人变得更聪明,它只是让每一笔交易都多了一个见证人。在这套底层结构之上,银行随后运转了数百年,用的正是我们今天会称之为“智能体”的东西——有签字权限的职员、账本,以及审计员。受治理情境下的自主劳动,并不是 2026 年才发明出来的新鲜事。信任从来都不是一个人的属性,它是账本的属性。

我把这套理论用在了它自己的发布会上

自测环节:写这篇文章的同时,我把峰会材料本身喂进了我的开源流水线——输入散文笔记,输出确定性的知识主干。十六个概念,十七个引用来源,每个概念都能溯源到一个标题,每个来源都对应一个真实 URL;外加提取出的八项「技能」,每一项都附带一条诚实的notGoodAt 边界条件(零拷贝克隆无法隔离计算资源争抢;一个 feature store 也治不好一个没有复用纪律的团队)。不检索、不造节点——和目录强制执行的「不传闲话」规则一模一样。

The portable three-piece onboarding kit
这套上岗工具包是可移植的:身份与认证 · 带溯源的上下文主干 · 能说「不」的评估闸门。

真正值得抄走的是这一点:这套模式不依赖任何特定厂商。三个组件,哪里都能搭建起来,全部开源在我的仓库里——一个身份/认证层,让智能体成为一个权限受限、可审计的主体(brace); a 上下文主干,带有溯源必填节点(FDE-os:knowledgefy 加上 jd-compiler 流水线);以及一个能说「不」的评估闸门,跑在 CI 里(cli-judge、rag-eval-harness)。各大平台如今都在把同样这三块东西打包成托管产品发布,我认为这是趋同证据,而非巧合。

上岗是一个循环,而这个循环本身就是护城河

The onboarding loop
工牌 → 手册 → 试用期 → 信任 → 循环往复。每一次被审核过的任务,都会充实下一个智能体所继承的记忆。

按这个顺序跑这个循环——和给一个人办上岗手续的顺序完全一样,顺序本身很重要:

这也是为什么这套打法比追新模型更划算:模型升级对所有公司一视同仁,上下文层却只帮你自己。 下一个前沿模型发布的当天,你的对手也会同步变强;但那一万条经过审阅、留有审计痕迹、可追溯数据血缘的任务记忆,只属于你一家。上岗这一课只需上一次——此后无论换哪家实验室的模型,新来的智能体都直接从 83 分起步,而不是 24 分。

记住这一句就够了

史上最聪明的新人正站在你家前台,问题恰恰出在前台。

别再忙着升级模型了,开始给它办上岗吧:一枚工牌、一本手册、一段试用期——身份、上下文、评测。


AI-Native 系列的更多文章

这些内容都收录在主页的 Writing 板块里。

本文属于 AI-Native 系列。支撑这篇文章的知识图谱、技能库与处理流水线均已开源:github.com/wjlgatech/FDE-os。参考来源:Atlan:Summit 2026 回顾 · Futurum · Constellation Research · OpenAI × Snowflake.