Paul Jialiang Wu agentic-portfolio English 中文 Español 한국어✉️ 無料リスト
← ポートフォリオに戻る

AI-Nativeシリーズ・研究検証

私のAIは捏造引用を見抜いた。そして自らの死角を名指しした。

1分でわかる要点

私は自作の研究検証ツールを、実在する未発表のAI論文2本に向けて試してみた。すると8件の捏造引用と、裏付けとなる結果が一切ない看板指標を検出し、さらに自分自身がまだできない3つのことを名指しした。もっとも強力な結果は、そのツールが自らの規則を自分自身に適用したことだった。

私は、研究上の主張が信頼できるかどうかを判定するツールを作った。そしてそれを実在する未発表論文2本に向けて使い、自分自身にも採点させた。読了約7分。

My AI caught the fake citations, then named its own blind spots — what it caught vs. what it couldn't
正直なスコアボード:左には成果、右には見逃した点——隠さずに並べる。

誰もが試すデモこそが、あなたを欺くものだ

どんなAIツールも、作り手が選んだ例の上では見事に輝く。本当に意味のあるテストは、現実の側が入力を選ぶものだけだ。だから私は、自分が作ったツール——AIが書いた主張が信頼できるかどうかを判定することだけを仕事とする研究検証ツール——を、実在する未発表論文を執筆中の同僚に頼み、その未発表のAI論文2本に向けて使ってみた。許可を得て、進行中の実プロジェクト上で直接動かした。

このツールが課すルールは、あえて言えば地味そのものだ。ある主張が「検証済み」となるのは、引用が実際に解決し、かつ証拠がその主張の強さを実際に裏付けている場合に限られる。 それ以外は⚪未証明に格下げされる——こっそり格上げされることは決してない。フィクスチャはツールが動くことを証明するにすぎない。それが本当に役立つ.

かどうかを証明するのは、実際の論文のほうだ

何を捕まえたか(数分で)

その後、修正はコミットされ、実際のプロジェクトにプッシュされた。それぞれがレビュー可能な差分としてだ。スライドショーではない——ソース内の変更であり、履歴上いつでも元に戻せる。

The claim-gate: a claim must have a citation that resolves and evidence that supports its tier, or it drops to unproven; plus the evidence ceiling ladder
ゲートを一枚の図にすればこうなる。捏造された引用は決して解決しない。結果のないメトリクスはLLMがでっち上げたにすぎない。どちらも⚪に着地する——気分ではなく、ルールによってだ。

15歳でも実践できるメンタルモデル

すべての主張に引用を付け、それを短い梯子に沿って上らせていく。引用は解決するか。 No → 未証明。 その種のエビデンスは、主張されている強度を裏付けているか? 実験で観測した数値は「検証済み」になり得るが、AIが単に主張しただけの数値はそうはいかない。モデルの外側から裏付けが得られない限り、未証明のままだ。すべての段を突破した主張だけが最上位を得る。それ以外は捨てられるのではなく、正直にラベル付けされるだけである。

これが仕掛けの全部であり、優れた科学がすでに使っている仕掛けと同じものだ。このツールはそれを機械的にしているだけだ——だから「信じてくれ」が「検証済み」として紛れ込むことはない。

できなかったこと——そしてそれこそが本当の成果である理由

ここからが、たいていのデモが省略する部分だ。このツール自身の第一原則は自分の盲点を名指しすることであり、私はそれを自分自身にも適用させてみた。正直な見落としが三つある。

そこで私は当然の次の一手を取った。つまり、欠けていた部分を作ったのだ。原稿を走査して未執筆の節、偽の引用プレースホルダー、根拠のない指標を検出し、候補となる主張をそのまま同じゲートに流し込む原稿読み取り機である。同じ日にテスト付きでリリースした。ギャップは機能へと変わり、その機能は自らの次なる限界を名指しした(抽出器はまだ過剰に検出しすぎる)。この循環——見落としを見つけ、それを塞ぎ、新たな限界を認める ——それこそが要点だ。

見落としこそが最大の成果である理由

自分自身に対して誠実かどうかを信用できない検証ツールは、検証ツールが存在しないよりも始末が悪い——それは信用を偽装してしまう。この試みが証明した最も重要なことは、8件の偽の引用を見つけたことではない。自らの作り手を採点させたとき、左の列と右の列を備えたスコアボードを出力したことだ。信じるべきはラベルではなく、成果物そのものだ。信頼が実際に生まれるのは、この右の列からなのだ。

品質を判定する何か——コードレビュー、リサーチチェック、評価用ハーネスなど——を作っているなら、テストの本質は「自分自身のデモに通るか」ではない。「見えていないものを、そのまま告げてくれるか」だ。失敗を隠さず声に出すツールを作るべきだ。


AI-Nativeシリーズのその他の記事

これらすべては、ホームページのWritingセクションにある。

AI-Nativeシリーズの一篇。検証ツールは自らのルールを自分自身に適用した——vibeではなく検証を、そして自分の死角を名指しすること。Publishボタンを押す権利は、あなた自身にある。