Paul Jialiang Wu agentic-portfolio English 中文 Español 한국어✉️ 無料リスト
← ポートフォリオへ戻る

AI-Nativeシリーズ・08

83%のエージェントと24%のエージェントは、同じモデルである

1分でわかる要点

Snowflake Summit 2026の目玉数字:同じモデルが単独では24%、ガバナンス済みコンテキストがあれば83%のスコアを叩き出した。AIエージェントが馬鹿なのではない——コンテキストに飢えているのだ。オンボーディングのメンタルモデルを、用語ごとに見ていく。

AIエージェントが馬鹿なのではない——コンテキストに飢えているのだ。エージェント型企業のためのオンボーディングのメンタルモデルを、実際に出荷されたものと用語ごとに突き合わせる。約8分。

The same model at 24% alone and at 83% wrapped in identity, memory, and audit rings
同じ頭脳、二つの数字。違いを生むのは、その周りを取り囲むすべてだ。(アニメーション表示——少し待ってほしい。)

一つの数字が、2万人規模のカンファレンスから生まれた

この6月のSnowflake Summitは26個以上の新機能を、たった一つのテーゼの下に出荷した。すなわち、エージェント型企業を動かすのは計算力だけではなく、ガバナンス済みコンテキストだ、ということだ。発表の大半は、カンファレンス発表につきものの記憶の霞の中に溶けていくだろう。だが、この一つの数字だけはそうであってはならない。

エンタープライズ・メモリ層——クエリ履歴、メタデータ、ダッシュボードから自動的に構築される——を備えることで、エージェントはビジネス上の質問に対して報告値で83%の精度。なければ24%。モデルは同じ。データウェアハウスも同じ。唯一の変数は、エージェントがこの特定の会社が世界をどう定義しているかを教えられていたかどうかだった。

ここで一度、優先順位を組み直してみよう。エージェントの出来が悪いとき、業界のデフォルトの反応はモデルを乗り換えることだ——次のリリースを待ち、より上位のプランに課金する。だが、この数字はその反応が逆であることを示している。ボトルネックはモデルだったことなど一度もない。オンボーディングだったのだ。

メンタルモデル:史上最も優秀な新人が、初日を迎える

ここに全体像がある。頭字語ひとつ使わなくても理解できるほどシンプルだ。

あなたの会社に加わったフロンティアモデルは、史上最も優秀な新人だ——バッジもなく、ハンドブックもなく、上司もいない会社に、初日から出社してくる。

その新人にQ3の売上を尋ねると、自信満々に4つの数字が返ってくる。どれも本物で、どれも違う数字だ。バカだからではない——「売上」という言葉が社内のシステムごとに4通りの意味を持っていて、どれが唯一の正解なのか誰も教えていないからだ。良質なデータがある部屋にバッジで入ることもできないから、そのへんに転がっているものから即興で組み立てる。そして誰もその仕事をレビューしないから、その場しのぎがバレるのは本番環境に出てからだ。

Day-one genius versus the same hire onboarded
初日の天才がバカだと結論づける者は誰もいない。誰もが、オンボーディングがまだ済んでいないだけだと結論づける。

人間の天才が入社1週目に成果を出せなくても、マネージャーは「もっと賢い天才が必要だ」とは言わない。バッジを渡し、ハンドブックを手渡し、誰が何を担当しているかを教え、信頼が得られるまで仕事をレビューせよ、と言うはずだ。それこそが、それ以上の神秘性など何もない、エージェント型エンタープライズのスタックの正体なのだ。

用語ごとに見る:オンボーディングキットはもう実在する製品だ

実際のプロダクトシートに耐えられないメンタルモデルは、単なる飾りにすぎない。というわけで、ここに対応表を示す——右側の各行は、今年プラットフォームのプリミティブとして実際に出荷されたものだ。

Onboarding terms mapped to platform primitives
左列は直感のために。右列はアーキテクチャレビューのために。

バッジ=エージェントのアイデンティティ。最も重要な発表は、モデルではなかった。AI Agent IdentityがGAとなり、すべてのエージェントに暗号学的アイデンティティ、エージェント単位のRBAC、そして完全な監査証跡が付与されるようになった。エージェントはいまやプリンシパルであり、どこかのチームが借りたサービスアカウントの下で動くスクリプトではない(セキュリティの観点で言えば、インターンにマスターキーとあなたの信用を貸し与えるようなものだ)。

ハンドブック=コンテキストレイヤー。 エンタープライズメモリ(Cortex Sense)は、組織のクエリ、ダッシュボード、メタデータといった実際の振る舞いから、その組織がビジネスをどう定義しているかを学習する。これが24→83を動かすレバーだ。text-to-SQLについても、セマンティックモデルは同じ役割を果たす。精度の問題は「モデルがSQLを書けるか」ではなく、「あなたの会社にある4つの『収益』のうち、どれが本物かをモデルが知っているか」だったのだ。

組織図=リネージュ(lineage)。 ガバナンスの効いたカタログは今、ウェアハウスの外——Postgres、Tableau、dbt——からもメタデータを取り込み、カラム単位のリネージュを持つ。これが強制するルールは、データサイエンティストなら誰もが既に信じているものだ。リネージュのない答えは、単なる噂にすぎない。

試用期間=評価(evals)+監査+ヒューマンゲート。 すべてのアクションが記録され、品質は基準に照らして測定され、自律性は根拠が示されたときにだけ拡張される。信頼は、レビューされた仕事によって獲得される。人間にとっても、そして今や構造的に、エージェントにとっても。

3つの望遠鏡——一つの派手な数字だけではアーキテクチャにならない

「文脈こそがレバーだ」というテーゼにロードマップを賭ける前に、3つのズームレベルで検証してみよう。

Three telescopes: 30 days, 30 years, 500 years
直近の兆候、生存の兆候、そして古来の法則——どれも同じ方向を指している。

30日(それは今、話題か?)。 ある一つのサミット、26以上の新機能、一つのテーゼ。そしてフロンティアモデルをデータの境界の内側で動かす、データを外に出すのではなく、という約2億ドル規模のパートナーシップ。そして83対24の見出しの数字。誠実さこそがこのブランドの本質だから、正直税をここで払っておく。この数字はvendor-reported at a vendor conference(訳:ベンダーのカンファレンスでベンダー自身が報告した数字)——エビデンスの階層としてはclaimed(訳:主張されている)段階であり、独立した再現検証はされていない。私はこれを定数ではなく、方向性として扱うことにする。それでも、その方向性は目を引くものだ。

30年(それは生き残ったか?)。 データの世界で長続きした勝者は、すべて同じ動きをしてきた。作業をガバナンスの効いたデータのより近くへ持っていく、という動きだ。ウェアハウスは計算をデータの側へ移動させた。ナレッジグラフ(2012年、「文字列ではなくモノ」)は意味をより近くへ移動させ、そのハイプサイクルを生き延びた。フィーチャーストアはMLの定義をより近くへ移動させた。一つの定義を二つの利用者が共有し、train/serve間のスキューは英雄的な努力ではなく契約によって解消された。この歴史のどの年にもモデルは入れ替わり続けたが、その周りの構造は積み重なっていった。

500年(それは古来の法則か?)。 1494年、Luca Pacioliは複式簿記を体系化した。それはヴェネツィアの商人たちを賢くしたわけではない。すべての取引に「もう一人の証人」を与えたのだ。この土台の上で、銀行はその後何世紀にもわたって、今でいう「エージェント」——署名権限の限度を持つ事務員、台帳、監査役——を運用してきた。ガバナンスの効いた文脈のもとでの自律的な労働は、2026年に生まれた発明ではない。信頼とは、人そのものの属性ではなかった。台帳の属性だったのだ。

自分の主張を、その発表自体で検証してみた

ドッグフーディング検証:本稿を書きながら、私はサミットの資料そのものを自作のオープンソース・パイプラインに通してみた。散文のノートを入力すると、決定論的な知識スパインが出力される仕組みだ。16の概念、17の引用元、すべての概念が見出しに、すべての出典が実在するURLに紐づいている。さらに8つの「スキル」を抽出し、それぞれに正直なnotGoodAt危うさを添えた(ゼロコピー・クローンは計算リソースの競合を分離しない。フィーチャーストアは、再利用の規律がないチームまでは救えない)。検索もノードもなし。カタログが強制するのと同じ「噂禁止」ルールを、ここでも守っている。

The portable three-piece onboarding kit
オンボーディングキットは持ち運び可能だ:アイデンティティと認証・来歴付きのコンテキストスパイン・ノーと言えるエバルゲート。

盗む価値があるのはここだ。このパターンは特定のベンダーを必要としない。3つの部品はどこでも構築でき、すべて私のリポジトリで公開している。アイデンティティ/認証レイヤーにより、エージェントはスコープ付きの監査可能なプリンシパルになる(brace); a コンテキストスパインは来歴必須のノードを備える(FDE-os:knowledgefy と jd-compiler パイプライン)。そしてノーと言えるエバルゲートはCIの中で機能する(cli-judge、rag-eval-harness)。プラットフォーム各社が今まさに同じ3つの部品を管理型プロダクトとして出荷し始めているのは、偶然ではなく収斂的な証拠だと私は捉えている。

オンボーディングはループであり、そのループこそが堀になる

The onboarding loop
バッジ→ハンドブック→試用期間→信頼→そして繰り返し。レビューされたタスク一つひとつが、次のエージェントが受け継ぐ記憶を豊かにしていく。

このループはこの順序で回す必要がある。人をオンボーディングするのと同じ順序であり、その順序そのものが重要だ。

そして、これがモデル追いかけよりも優れた戦略である理由がある。モデルのアップグレードはすべての企業を平等に助ける。だがコンテキスト層は、あなたの会社だけを助ける。 次のフロンティアモデルのリリースは、あなたの会社を押し上げるのと同じ日に競合他社も押し上げる。だが、レビュー済み・監査済み・系譜追跡済みのタスクを一万件積み重ねた記憶は、あなたの会社だけを押し上げる。一度オンボーディングを済ませれば、以後はどの研究所から来たエージェントであれ、24%ではなく83%からスタートする。

覚えておくべき一行

史上最も優秀な新人が、あなたの会社のロビーに立っている。問題はそのロビーにある。

モデルのアップグレードをやめよう。代わりにオンボーディングを始めよう。バッジ、ハンドブック、試用期間——つまり、アイデンティティ、コンテキスト、評価だ。


AI-Nativeシリーズのその他の記事

これらはすべて、ホームページのWritingセクションにある。

AI-Nativeシリーズの一部。この記事の背後にあるナレッジグラフ、スキル、パイプラインはgithub.com/wjlgatech/FDE-osで公開している。出典:Atlan's Summit 2026 recap · Futurum · Constellation Research · OpenAI × Snowflake.