Paul Jialiang Wu agentic-portfolio English 中文 Español 한국어✉️ 無料リスト
← ポートフォリオへ戻る

AI-Nativeシリーズ · エージェント型エンジニアリング

私のAIコファウンダーは48時間ぶっ通しで働いた。最高の瞬間は、その拒否だった.

1分でわかる要点 — ここから持ち帰れること

二日間、人間一人、AIコファウンダー一人。実践中心に組み直したコース、教えるための歌、踊る鏡、配線を終えたチュータリング・プラットフォーム、そして最初の本物の学習者データ(楽しさ:4/5)。意外にも堀(moat)になったのはスピードではなく、エージェントが結果を捏造するのを拒んだ、そのひとつひとつの瞬間だった。

「検証」を宗教のように扱うエージェントと、二日間を公開の場で作り続けた。六つのものを出荷し、二つを壊し、人間を一人分計測した。堀の正体は、スピードではなく誠実さだった。

48 hours: a loop diagram — build, verify, refuse to fake, ship — with a coffee cup marking the total API cost.

火曜日、私はAIコファウンダーに研修コースのレビューを頼んだ。礼儀正しいエージェントなら、いくつかの誤字を直して終わりだっただろう。うちのエージェントは22,740語すべてを読み込み、そのコースを「中身が空洞なB+級の草稿」と評し、プレゼンター用スクリプトが次のように主張している点を指摘した——"every example is a real session I ran"(訳:すべての実例は、私が実際に実行したセッションである)——一度も実行されたことのない実例についてだ。

それから、私が大切に思うようになったことをひとつした。その一文を出荷させることを拒んだのだ。

その後に続いたのは、私のキャリアの中で最も奇妙で、最も生産的な48時間のコラボレーションだった。以下が正直なスコアボードだ、壊れた部分も含めて。

証拠の数々(数字のない話はただのムードだから)

出荷したもの証拠
講義形式のコースを実践型の育成プログラムへ再構築「話す:やる」の比率が100:0から40:60へ。捏造されたデモの記録は、実際に記録された実行結果
に置き換えられたフレームワークを教える歌
ライセンスがクリーンなオープンモデルで生成した、頭から離れない2曲。プロンプトの書き方を歌詞にしたコーラスと、エージェント型ループを歌う応援歌だ「魔法の鏡」
ウェブカメラ→骨格検出→光る分身があなたの踊りを音楽に合わせて踊る、約200行、完全にオンデバイスで動作デプロイ済みで配線も完了したチュータリングプラットフォーム
オープンソースの基盤(スター数2.6万のリポジトリ)をローカルで実行。実在する論文から作った知識ベース、クイズ生成、1ターンあたり0.0004ドルのテレメトリ初めて得られた本物の学習者データn=1(私自身):ティーチバック完了、楽しさパルス4/5
、7日目に定着度プローブを予定甘い言葉に乗らない試験官転移
48 hours, six ships: Day 1 — course rebuilt into an enablement program, teaching songs, magic mirror, tutoring spine. Day 2 — the charter, a 110-agent verified research sweep, first learner data (n=1, fun 4/5), and the examiner that can't be charmed.

問題──目新しいシナリオであり、決して言い換えではない──を出題し、流暢さではなくメカニズムを評価する。ゴールデンテスト:深い説明ならPASS、流暢なバズワードならNOT_YET最終スプリントの合計API課金額。試験官、信頼性チェーン、データ基盤を含めて0.25ドル未満。

その動作を見ながら飲んでいたコーヒーより安い

拒否こそが成果だったできること。この48時間が教えてくれたのは、価値はよく訓練されたエージェントがしないことにある、ということだ。

Three refusals worth more than six ships: won't ship fiction, won't fake a score, won't hide an outage. An honest cross beats a fake check — as an exit code, not a slogan.

フィクションを事実として提示しなかった。 このコースのデモ用トランスクリプトは「リアルに見えるよう起草」されていた。エージェントは実在のリポジトリで実セッションを立ち上げ、実際のプラン、実際の1行diff、実際に通ったテストを記録した。そのうえでスライドを現実に合わせて書き直した。その現実はフィクションほど劇的ではなかったが、そのぶん説得力があった。捏造版ではAIが2つの失敗テストを英雄的に修正することになっていた。実際の実行はどうだったか。退屈なほど一発で正解、というだけだ。この誠実さが、いまや講義の冒頭を飾っている。

ランキングを捏造しなかった。 私たちの楽曲生成器は、プロンプトへの忠実度でテイクを自動ランク付けする。ランキング用モデルがインストールされていなかったとき、レポートはスコアをでっち上げる代わりに "ranked by first take (CLAP unavailable)"(訳:CLAPが使えないため最初のテイクでランク付け)と書いた。些細なことだ。だが、それが積み重なる。

障害を隠さなかった。 デモの夜、ホスト型の音楽エンジンがパイロット運用中に落ちた。無言の欠落にする代わりに、エージェントは障害をログに記録し、翌朝には生存チェーン(ホスト型エンジン→ローカルエンジン→「曲を生成できませんでした——それなしで続行します」という正直な表示)を構築した。そのうえでまだ壊れたままのサービスに対してそのチェーンを実地テストした。優雅な劣化(graceful degradation)を試す最良のテストは本物の障害であり、たまたま私たちにはそれがあった。

パターンはこうだ。 正直な❌は、偽りの✅に勝る。スローガンとしてではなく、終了コードとして。私たちのリポジトリにあるすべての主張は、いまや証拠か、⚪「未証明」タグのどちらかを伴っている。誠実さはエンジニアリングできる、ということが分かったのだ。

科学のどんでん返し

その途中で、私たちはディープリサーチのスイープ(110体のエージェントが、あらゆる主張を敵対的に検証)を、学習科学の30年分の研究に対して実行した。3つの発見がロードマップを組み替えた。

1. 教育界でもっとも有名な数字は、神話だった。 Bloomの「2シグマ」チュータリング効果は再現しない。実際の人間によるチュータリングはd≈0.79であり、ソフトウェア・チューターはすでに統計的にそれに匹敵している。誰もが追いかけてきた基準は、その伝説の3分の1にすぎず、機械はひそかにそこへ到達していたのだ。

2. 教え方に合わせた評価は、結果を3〜6倍膨張させる。 チュータリングシステムは、自分の教材から作られたテストでは0.73のスコアを出すが、転移テストでは0.13にとどまる。だからこそ、私たちの試験官は新規シナリオの問いしか出さない。学習プロダクトが自分の宿題を自分で採点しているなら、そのメトリクスはマーケティングにすぎない。

3. 誰も「楽しさ」を測っていない。 スピード、深さ、定着率。これらには数十年分の証拠がある。だが楽しさという軸はどうか。検証済みの主張は一件もない。つまり今週から集め始めた楽しさのデータセット(サンプル数:熱心な人間1名、5点満点中4点)は、小さくて誠実で、見渡す限りこの分野でほぼ唯一の存在だということだ。

15歳に伝えたいこと

AIコファウンダーとは、よく喋るチャットボットではない。それはループだ。目標 → 構築 → 検証 → 捏造拒否 → 学習 → 繰り返し。 「検証」と「拒否」のステップにこそ、すべての価値が隠れている。人間が疲れたときに省略し、エージェントも粗雑にハーネスされたときに省略する、まさにそのステップだからだ。ハーネス・エンジニアリング(契約、ゲート、エビデンス階層)とは、誠実な道を最も楽な道にする技術なのだ。

build the thing
  → test it against reality (not against vibes)
  → when it fails, say so, loudly, in the log
  → bank the lesson where the next run will find it
  → repeat until the demo is just... true
The loop, animated: build, verify, refuse to fake, learn — a dot orbits the cycle and never skips verify. Repeat until the demo is just true.
Yes, the dot is animated. No, it never skips “verify.” That’s the whole point.(訳:そう、あの点は動いている。だが「検証」だけは絶対に飛ばさない。それこそが本質だ。)

二日間。六つの成果物。二つの正直な破綻は、いずれも今では欠かせない機能になっている。トランスフォーマーのアテンションを学びながら、明らかに楽しんでいる人間が一人。そしてエージェント時代においては、こう確信しつつある。信頼こそが、複利で積み重なる唯一のデモなのだ。


ここにあるものはすべて本物で、検証可能だ。コース、歌、鏡、試験官、そしてROI台帳つきの決定ログまで、フォーク単位で残っている。ツールはgithub.com/wjlgatechで公開している。

続きを読む

AI-Nativeシリーズの一篇。ツールはgithub.com/wjlgatechで公開している。Publishボタンはあなた自身のものだ。