ループを閉じろと命令することはできない——だからもうやめよう
1分でわかる要点
CNOのゲーム、maker≠checker、そしてSolidityによるオンチェーン・インセンティブ。
AIネイティブなロボティクス企業におけるトップダウン対ボトムアップ:勝者はなぜ命令を怒鳴る代わりにゲームを設計するのか——エンジニアが明日にでも作れる、スマートコントラクトに至るまでの正確な仕組みとともに。
これは、あなたも見たことのある光景だろう。
ある幹部が立ち上がり、新しい戦略を発表する。"Everyone here needs to innovate. Own it. Be entrepreneurial."(訳:全員がイノベーションを起こせ。自分ごととして引き受け、起業家精神を持て。) スライドにはロケットが描かれている。全員がうなずき、自分の席に戻り、前日とまったく同じ量だけ「イノベーション」を起こす——つまり、また指示を待つ。
一方、3マイル離れた場所にある、より小規模なロボティクス企業のTitanクラス・ロボットは、測定可能なレベルで着実に不器用さを減らしている毎晩欠かさず。しかも、それを上層部が指示したわけではない。ある現場技術者が、朝の光の中でグリッパーが透明なコップをうまく扱えていないことに気づき、ひとつの実験を行った。そしてその修正は今、彼女に自動的に、オンチェーンで報酬をもたらしている。
その一枚の絵に、この戦いのすべてが詰まっている。トップダウンは「ループを閉じろ」と人に命じる。ボトムアップはループを閉じることが明らかに得な手になるよう仕組み、あとは手を引く。
私はこの間、二つ目のタイプの会社(AIネイティブなPhysical AIオペレーティングシステム)のランタイムを作り続けてきた。まずは15歳でも一瞬で理解できるメンタルモデルを示し、そのあとエンジニアに渡すべき部品——Solidityも含めて——を手渡すことにする。
メンタルモデル:二つのキッチン
同じ通りに二つのレストランがあると想像してほしい。
キッチンAはトップダウンだ。ヘッドシェフがパスに立って怒鳴っている。グリルが詰まれば、いつか気づいて叫ぶ。料理人がもっと速い仕込み方を思いついても、シェフの機嫌がいいタイミングを狙わなければならない。すべての改善は一つの過負荷な脳を経由しない限り実現しない。忙しい夜のキッチンAは、ボトルネックがコック帽をかぶって立っているようなものだ。
キッチンBはボトムアップ——オープンキッチンだ。すべての料理人が見えるのは、チケットタイム・ボードだ。グリルが詰まったら、誰でもそれを指摘し、一シフト・一ステーションだけ仕込みを変えて試せる——範囲が限定され、元に戻せる形でだ。変更を加えた本人ではなく、エキスポ(配膳係)が、実際にチケットタイムが下がったかどうかを確認する。そしてチップの計算式は壁に書いてある。検証済みの改善は自動的に払われ、効果が続けば額も増える。キッチンBのヘッドシェフは決して料理をしない。彼はキッチンを作り、冷蔵庫を冷やし、包丁を研ぎ、公平で不正のできないチップの計算式を書くのだ。
キッチンAはたった一人の天才の分だけ拡張できる。キッチンBは全員の分だけ拡張できる。
用語ごとの対応表——エンジニアがキッチンBを作れるように
コンポーネントに対応しないメタファーは、単なる良い気分に過ぎない。以下がその対応関係だ——CNO(Chief AI-Native Officer)がヘッドシェフに当たり、それ以外はすべてシステムとなる。
| キッチンB(15歳が思い描くもの) | システム(エンジニアが構築するもの) |
|---|---|
| チケットタイム・ボードが全員に見える | 自動で浮かび上がるギャップボード──摩擦センサーと現場の対応力、そしてNo人間の時間を最も消耗しているワークフローの組み合わせ |
| 調整を試すのは一つのシフト・一つのステーションに限定した | A 境界付きクローズドループ:仮説+単一メトリクス+ロールバック。立ち上げは安く済み、安全ゲートが本番環境から締め出す |
| エキスポ(進行管理役)が確認するのであり、作った本人が確認するわけではない | 独立した審判 — maker ≠ checker。変更を行った本人が、その認定を行うことは決してない |
| 壁に貼られたチップ formula | オンチェーンのスマートコントラクトが支払うのは検証済みクローズ――努力量ではない、提案でもない |
| 支払いはその改善が効き続ける限り増える | コンパウンディング・ベスティング――報酬は流れ続け、持続性を再検証するたびに延長される。人はレバレッジを追い求める。喝采ではない |
| "「店を燃やすな」がチップより優先される | A セーフティ・ゼロ・ゲート――安全性の失敗はROIに関係なく報酬をゼロにする |
| 料理長は決して料理をしない | CNOはインフラ・文化・コントラクトを構築するが、人に代わってループを閉じることはしない(それをやればボトルネックを再構築するだけだ) |
右の列を読んでほしい。これは雰囲気の話ではない――組織設計そのものだ。そしてその中心にあるコントラクトは、見た目より小さくて済む。
コントラクト、それが実際に生きている言語で語ると
この3つの譲れない条件は、価値観ポスターではない――それはrequire宣言文だ:
// maker != checker — enforced in code, not in a handbook
function attestClose(uint256 id, uint256 reward) external {
require(isChecker[msg.sender], "not a referee");
require(msg.sender != closes[id].maker, "maker != checker"); // the whole point
// ...fund a vesting stream that re-verification extends (compounding)
}
// safety is a terminal gate, not a weighted term
function flagSafety(uint256 id) external onlyGuardian {
// zero the UNRELEASED reward and halt — regardless of ROI
}
作業をした本人が自分の成果に金銭目的でサインオフできるなら、自分の宿題を自分で採点することになる。だからこそ「maker≠checker」はmaker != checkerオンボーディング資料の一文ではなく、Solidityの一行として書かれる。そして複利的な改善に報酬を与えるのであって、一度きりの成果には与えない。人的負担を下げ続ける修正ほど、時間とともに多く報われる。このたった一つのつまみが、人々にボーナス型トロフィーではなくレバレッジを追わせる。
「でも上にいる優秀な人たちが決めるべきでは?」——ロボティクスのエビデンスが語ること
ここが直感に反する部分だが、これは経営論ではない。ロボットに関する研究が示し続けていることそのものだ:多様性は単一の指令知能に勝る。
- Open X-Embodiment / RT-X(2023年)は次のデータを統合した——22種類のロボット、21の機関、527のスキル、16万以上のタスク——その結果、ロボットの機体をまたいだ正の転移が確認された。モデルが向上したのは入力が多様だったからであり、一つの研究所が全てを指図したからではない。ある実世界での操作研究では、改善は同じデモを繰り返す回数ではなく、環境とオブジェクトの多様性に比例してスケールすることが分かっている。
- RT-2(Google DeepMind、2023年)は、厳選されたカリキュラムではなく、広範で未整理のウェブ知識を吸収することで汎化能力を獲得した。
- π0.5π0.5(Physical Intelligence、2025年)は、一度も見たことのない家庭にまで到達した。それを実現したのは異種混合の共同学習(heterogeneous co-training)——複数のソースを組み合わせる手法だ。
組織図に翻訳するとこうなる。すべての改善を頂点の役員一人に集約させる会社は、一つの角度から見た一つの青い箱だけで訓練されたロボットのようなものだ。茶色の箱が現れるまでは絶対的な自信を見せるが、現れた瞬間、実存的危機に陥る。ボトムアップはお人好しの選択肢ではない。引用文献つきの選択肢なのだ。
落とし穴もある——トップダウンがしぶとく生き残る理由でもあるのだが——それは信頼だ。ボトムアップがうまく機能するのは、悪いアイデアが害を及ぼせず、良いアイデアが偽装できない場合に限られる。まさにそれを担保するのが、独立した審判とセーフティ・ゼロ・ゲートだ。これがあるからこそ、会社は全員に安全に実験させられる。なぜなら、検証されていないものは出荷されず、安全でないものは生き残らないからだ。この二つを取り除けば、「全員に権限を与える」は「みんなの楽観主義、フィルターなし」になる——それこそが、とても速く、そしてとても事故報告書向きなロボットが生まれる仕組みだ。
正直な手順を踏め(飛ばすな)
いきなりSolidityを書き始めてはいけない。まずはホワイトボードから始める。オープンループ・ボードを掲げ、誰でもギャップを申告できるようにし、独立した指標で一つの実験を走らせ、最初の検証済みクローズには手動バウンティから報酬を支払う。人間がループの中にいる状態で、このゲームが楽しくフェアであることをまず証明するのだ。その後で、うまくいった正確な報酬計算式をコード化する。手で一度も回したことのないインセンティブをコードに落とすな——契約の役割はただ一つ、証明済みの文化を恒久化し、ごまかしの効かないものにすることだ。
結末はこうだ。エッセイ全体の主張を一息で言えば、こうなる。
トップダウンの会社は、トップに立つ人間の最高の一日分の賢さしか持てない。一方でボトムアップの会社は——審判と安全ゲートがあれば——全員が眠っている間にも、毎晩賢くなっていく。後者を作れば、ロボットは勝手にぎこちなさを減らしていく。前者を作れば、あなたが手にするのは脚の生えた高価なトースターと、パスに立って「もうすぐ素晴らしくなる」と言い張る幹部だけだ。
だから問うべきは「どうすれば人に関心を持たせられるか」ではない。
こうだ——問うべきはこうだ——命令を叫んでいるのか、それとも壁にチップの計算式を書いたのか。
私はこれを公開の場で構築している。Physical-AI-nativeな企業OS(役割、運用ループのドクトリン、オンチェーン・インセンティブの設計図)と、その基盤となるループ・エンジニアリングのフレームワークsosだ。あなたのチームがトップダウンとボトムアップの間で行き詰まっているなら、どこで破綻しているのかコメントで教えてほしい。すべて読む。
→ インセンティブのドクトリンとSolidityの設計図を読む — repo: github.com/wjlgatech/physical-ai-native
#PhysicalAI #Robotics #AInative #Web3 #Leadership #BuildInPublic
参考文献(すべて実在し、検索可能)
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models — Open X-Embodiment Collaboration, 2023(22種のロボット・527のスキル・16万以上のタスク)。
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control — Google DeepMind, 2023。
- π0.5: a Vision-Language-Action Model with Open-World Generalization — Physical Intelligence, 2025。
- Reflexion: Language Agents with Verbal Reinforcement Learning — Shinn et al., NeurIPS 2023(エージェントのための独立フィードバックループ)。
数字は上記の出典で報告されているとおりに引用している。厨房とフロア技術者の話は説明のための例示だ。ここに書かれた主張がこれらの出典に遡れない場合は、事実ではなく意見として扱ってほしい。
ドラフト — github.com/wjlgatech/physical-ai-native より。モバイルで読めるように共有している。公開ボタンを押すのはあなただ。