Paul Jialiang Wu agentic-portfolio English Español 한국어 日本語✉️ 免费订阅
← 返回作品集

AI-Native 系列 · 研究验证

我的 AI 抓出了假引用,然后自曝了它的盲区

一分钟速览:这篇文章能带给你什么

我把自己开发的研究验证工具,对准了两篇真实的、尚未发表的 AI 论文。它抓出了 8 处捏造引用,还有一个没有任何结果支撑的核心指标——然后它自己列出了三件它现在还做不到的事。这次测试最有力的结果,是它把自己的规则用在了自己身上。

我做了一个工具,用来判断一条研究结论是否可信。然后我把它对准了两篇真实的、尚未发表的论文——并让它给自己打分。约 7 分钟读完。

My AI caught the fake citations, then named its own blind spots — what it caught vs. what it couldn't
诚实的记分牌:左边是拿下的分数,右边是被点名的失误,一样不藏着掖着。

人人都爱跑的那个演示,恰恰是骗你的那个

任何 AI 工具,在开发者挑好的例子上,都会显得无比聪明。唯一有意义的测试,是让现实来挑选输入,而不是你自己挑。于是我拿出自己做的一个工具——一个研究验证器,它唯一的工作就是判断一条 AI 写出来的结论是否可信——然后把它对准了两篇真实的、尚未发表的AI 论文,是一位同事正在起草的东西。在获得许可后,我让它直接在这个正在进行中的项目上运行。

这个工具执行的规则故意设计得很朴素:只有当一条论断的引用真的能找到出处、证据的强度真的撑得起论断的强度时,它才算「已验证」。 否则就会被降级为 ⚪ 未证实——绝不会悄悄被升级。固定测试数据只能证明程序能跑;真实论文才能证明它到底有没有.

它抓到了什么(只花了几分钟)

两篇初稿都带着同样的毛病,正是这些毛病在悄悄侵蚀人们对 AI 辅助研究的信任:

接着这些修改被提交并推送到了这个进行中的项目里,每一处都是可审阅的差异(diff)。这不是幻灯片式的演示——而是源码里真实的改动,且在历史记录中可回溯、可撤销。

The claim-gate: a claim must have a citation that resolves and evidence that supports its tier, or it drops to unproven; plus the evidence ceiling ladder
一图看懂这道校验闸门。虚构的引用永远无法解析;没有结果支撑的指标就是 LLM 编造的。两者都会落在 ⚪ 这一档——靠的是规则,不是心情。

一个15岁的孩子也能看懂的思维模型

给每条论断配一个引用,然后让它爬一段短短的梯子。这个引用能解析出来吗? 否 → 未验证。 证据的类型撑得住这个断言的强度吗? 一个在实验中实测到的数字,可以判定为「已验证」;而一个 AI 单纯断言出来的数字则不行——它会被压在未验证这一档,直到有模型之外的东西为它背书。只有闯过每一道关卡的断言,才能拿到最高等级。其余的都诚实标注,而不是一删了之。

这就是全部的窍门,而且好的科学研究早就在用这一套。这个工具只是把它变得机械化——这样「相信我」就没法蒙混成「已验证」。

它做不到的事——这才是真正的成果

这是大多数工具演示都会跳过的部分。这个工具自己的第一原则是说出你的盲区——于是我让它把这条原则用在自己身上。三个诚实的短板:

于是我做了显而易见的下一步:我把缺的那一块补齐了——做了一个手稿阅读器,扫描草稿里未写完的章节、伪造引用的占位符,以及无据可查的指标,再把候选断言直接喂进同一道关卡。当天就连测试一起上线了。缺口变成了功能;这个新功能又指出了自己下一个局限(提取器还是太急于下判断)。这个循环——找到短板、补上它、再承认新的边界——这才是关键,别无其他。

为什么「没做到的事」才是真正的赢面

一个连自己都无法坦白交代的验证工具,比没有验证工具还糟糕——它只是在替虚假的信心洗白。这次测试真正证明的,不是它抓出了八条虚构引用,而是当我让它给自己的创造者打分时,它给出了一张有左栏、也有右栏的成绩单:要信任的是产出的东西本身,不是它贴的标签,而这份信任,恰恰来自右边那一栏。

如果你正在做任何用来判断质量好坏的东西——代码审查、研究核查、评测框架——真正的考验不是「它能不能在自己的演示里过关」,而是「它会不会告诉你它看不见什么」。真正该打造的,是那种敢于大声承认自己失败之处的工具。


AI-Native 系列更多文章

以上内容都在主页的Writing栏目里。

本文属于 AI-Native 系列。这个验证工具把自己的规则用在了自己身上——验证,而非凭感觉;主动说出自己的盲区。发布按钮,始终握在你自己手里。