AI-Native 系列 · 研究验证
我的 AI 抓出了假引用,然后自曝了它的盲区
一分钟速览:这篇文章能带给你什么
我把自己开发的研究验证工具,对准了两篇真实的、尚未发表的 AI 论文。它抓出了 8 处捏造引用,还有一个没有任何结果支撑的核心指标——然后它自己列出了三件它现在还做不到的事。这次测试最有力的结果,是它把自己的规则用在了自己身上。
我做了一个工具,用来判断一条研究结论是否可信。然后我把它对准了两篇真实的、尚未发表的论文——并让它给自己打分。约 7 分钟读完。
人人都爱跑的那个演示,恰恰是骗你的那个
任何 AI 工具,在开发者挑好的例子上,都会显得无比聪明。唯一有意义的测试,是让现实来挑选输入,而不是你自己挑。于是我拿出自己做的一个工具——一个研究验证器,它唯一的工作就是判断一条 AI 写出来的结论是否可信——然后把它对准了两篇真实的、尚未发表的AI 论文,是一位同事正在起草的东西。在获得许可后,我让它直接在这个正在进行中的项目上运行。
这个工具执行的规则故意设计得很朴素:只有当一条论断的引用真的能找到出处、证据的强度真的撑得起论断的强度时,它才算「已验证」。 否则就会被降级为 ⚪ 未证实——绝不会悄悄被升级。固定测试数据只能证明程序能跑;真实论文才能证明它到底有没有用.
它抓到了什么(只花了几分钟)
两篇初稿都带着同样的毛病,正是这些毛病在悄悄侵蚀人们对 AI 辅助研究的信任:
- 8 处虚构引用。看起来像文献、实则指向空处的占位符,比如
[cite: 611]——一个长得像事实的空洞。这道校验闸门会标记出每一处解析不到出处的引用;我把这八处全部替换成了一个显眼的[CITATION NEEDED]标记。 - 一个背后什么都没有的头条指标。两份摘要都宣称有个「时间一致性得分为0.92」——但翻遍全文也找不到任何结果表能算出这个数字。这道校验闸门把它降级为 ⚪ 未证实。我在原文里把它改写成了一个待验证的目标值——我没有编造一个结果,也没有悄悄删掉别人的论断。
- 在自主性上的过度声称。「多个并行智能体」在做高自主性工作的说法被自动封顶,因为这里的事实依据本身就存疑——如果你没法低成本核实答案,就不能自称是自动驾驶。
接着这些修改被提交并推送到了这个进行中的项目里,每一处都是可审阅的差异(diff)。这不是幻灯片式的演示——而是源码里真实的改动,且在历史记录中可回溯、可撤销。
一个15岁的孩子也能看懂的思维模型
给每条论断配一个引用,然后让它爬一段短短的梯子。这个引用能解析出来吗? 否 → 未验证。 证据的类型撑得住这个断言的强度吗? 一个在实验中实测到的数字,可以判定为「已验证」;而一个 AI 单纯断言出来的数字则不行——它会被压在未验证这一档,直到有模型之外的东西为它背书。只有闯过每一道关卡的断言,才能拿到最高等级。其余的都诚实标注,而不是一删了之。
这就是全部的窍门,而且好的科学研究早就在用这一套。这个工具只是把它变得机械化——这样「相信我」就没法蒙混成「已验证」。
它做不到的事——这才是真正的成果
这是大多数工具演示都会跳过的部分。这个工具自己的第一原则是说出你的盲区——于是我让它把这条原则用在自己身上。三个诚实的短板:
- 它还不能自己把论文读成一条条断言。 我得手动把断言抽出来,它才能去判断。它负责给断言把好关卡,但还不能自己读入一篇文档并生成这些断言。
- 它的引用检查是离线的。 它只能确认某条引用是否存在于论文自己的参考文献列表里——还没法主动联网去核实某个真实存在的网络来源。
- 「直接在线上项目里操作」靠的是管道工程,而不是这个工具本身。 真正靠谱的入口是这个项目的 git 后端,而不是工具本身——这个发现,比一场漂漂亮亮的成功更有价值。
于是我做了显而易见的下一步:我把缺的那一块补齐了——做了一个手稿阅读器,扫描草稿里未写完的章节、伪造引用的占位符,以及无据可查的指标,再把候选断言直接喂进同一道关卡。当天就连测试一起上线了。缺口变成了功能;这个新功能又指出了自己下一个局限(提取器还是太急于下判断)。这个循环——找到短板、补上它、再承认新的边界——这才是关键,别无其他。
为什么「没做到的事」才是真正的赢面
一个连自己都无法坦白交代的验证工具,比没有验证工具还糟糕——它只是在替虚假的信心洗白。这次测试真正证明的,不是它抓出了八条虚构引用,而是当我让它给自己的创造者打分时,它给出了一张有左栏、也有右栏的成绩单:要信任的是产出的东西本身,不是它贴的标签,而这份信任,恰恰来自右边那一栏。
如果你正在做任何用来判断质量好坏的东西——代码审查、研究核查、评测框架——真正的考验不是「它能不能在自己的演示里过关」,而是「它会不会告诉你它看不见什么」。真正该打造的,是那种敢于大声承认自己失败之处的工具。
AI-Native 系列更多文章
以上内容都在主页的Writing栏目里。
本文属于 AI-Native 系列。这个验证工具把自己的规则用在了自己身上——验证,而非凭感觉;主动说出自己的盲区。发布按钮,始终握在你自己手里。