AI-Native Series · Strategy OS
あなたの戦略デッキはもう死んでいる。私たちは戦略にCIを通した
1分でわかる要点——読み終えて得られるもの
戦略の大半はデッキとして死んでいく。裏付けのない数字、事実の顔をした予測、世界が変わったことに気づく仕組みの欠如。私たちは、戦略をコードのように審査するオペレーティングシステムを構築した。ドキュメントに対するmake check、エビデンスか沈黙か、そしてすべての決定を人間が握るという仕組みだ。それを実際のエンタープライズ案件でストレステストした。強み6つ、弱み7つ、裏付けつきだ。
すべての数字に裏付けが必要で、予測は事実の顔をできず、「準備完了」はムードではなくゲートだ——そんな戦略オペレーティングシステムを、実際のエンタープライズ案件でストレステストし、正直に採点した。強み6つ、弱み7つ、そして私たち自身の設計の中に見つけた仕様上の欠陥が1つ。
McKinsey Quarterlyは、この不安に数字を突きつけた。エンタープライズのLLM支出は3倍に増えた——12ヶ月でそうなった一方、トークン価格は崩落し、調査対象組織の93%がAI予算を超過し、AIはエンタープライズIT支出の4分の1に達しようとしている。彼らの決め台詞、"tokens are not value; tokens are the bill"(訳:トークンは価値ではない。トークンは請求書だ)は、実のところ戦略そのものについての一言だ。多くの組織は、どの賭けが成功しているのか、実際にいくらかかっているのか、自分たちのロードマップがどんな証拠の上に立っているのか、答えられずにいる。
そして、その賭けを管理するための道具は、いまだに……デッキだ。デッキとは、確信が最大になった瞬間に凍結された思考のスナップショットにすぎない。その数字の出どころは誰にも追跡できず、世界がそれを無効化したことに気づく仕組みも存在しない。デッキに「なぜこの準備度スコアは3.2なのか、何があればその判断が変わるのか」と尋ねても、返ってくるのは沈黙だけだ。
そこで私たちは代替案を構築し、そのうえで、多くの作り手が飛ばしてしまうことをやった。実際の案件でそれを壊そうと試み、スコアボードを公開したのだ。
フェーズ0:エンジンコードを1行も書く前に、20の成果物
このプロジェクトは戦略オペレーティングシステムだ——プライベートなメタリポジトリであり、そこでは戦略は文書ではなく、目的→エビデンス→診断→選択肢→意思決定→アーキテクチャ→実行→指標→適応という検証可能なオブジェクトとしてつながっている。どのリンクも検査可能だ。
エンジンのコードを一行も書く前に、実装前の成果物を20点作成した——ポートフォリオ一覧、9つのツールカテゴリにまたがるランドスケープレポート、25以上のフレームワークカードを含むフレームワークマップ、オントロジー、3つのアーキテクチャ選択肢、7件の意思決定記録、マイルストーン計画。そしてこれを本物にした一手が、次のものだ。
ドキュメントにCIパイプラインを与えたのだ。 フェイルクローズドな審査スクリプトがすべての成果物をチェックする——ファイルの欠落、中身のない内容、必須セクションの不在——それぞれが名前つきの失敗として記録される。make check:26/26。そして、このゲートが決してしないことが一つある。許可を推測しないことだ。人間の承認は、Status:という、人間だけが編集し、そのまま中継される一行に宿っている。
このシステムを支える設計原則は4つある。
- エビデンスか、沈黙か。 出所のないものはエビデンスではない。出典のない主張は、ラベルつきの「仮定」としてしか存在できない——「モデルがそう言った」は表現可能だが、それにふさわしく弱いものとして扱われる。
- 主張はそれぞれの階級を身にまとう。 事実、主張、仮定、推論、予測——予測が事実の見た目をまとって表示されることは決してない。これは要請ではなく、強制される。
- 意思決定を書けるのは人間だけだ。 AIは調査し、モデル化し、レッドチームを行い、下書きを作る。だが意思決定ノードは、構造上エージェントには書けない。
- 有名だからといって、正しいとは限らない。 われわれのフレームワーク調査では、エビデンスの質が知名度とほぼ逆転していることが判明した——最も人気のある戦略ツールのいくつかは、実は実証的裏付けが最も弱いのだ。だからフレームワークはエビデンス評価つきのデータとして扱われ、エビデンスの乏しいフレームワークは発想段階の役割に回され、決して評決の役割には使われない。
ストレステスト:手作業で行った実際のエンゲージメント
仕様書は安い。だからエンジンを構築する前に、われわれはこの手法を丸ごと手作業で実際の、機密扱いのエンタープライズ・エンゲージメントに適用した(詳細は非公開のままだ。それが機密ルールの機能している証だ)。出所つきのエビデンス台帳、反証可能な診断、本質的に異なる3つの選択肢、ステークホルダーの反応を伴うトレードオフ、90日計画。一通り揃っている。
うまくいった点(強み6つ、証拠はリポジトリにある): 分類の規律が功を奏し、ある情報源が「要約の要約」に過ぎないことを見抜いて、正直に評価を下げさせた。診断スキーマは最初の草案を却下した。中身は目標リストが戦略のふりをしていただけだったからだ。そして「とりあえず選んだ戦略を書いてしまおう」という誘惑に対しても、オントロジーは「ノー」と答えた。契約書には正直にこう書かれているChosen Strategy: NONE——まだ人間が決定を下していないからだ、と。
うまくいかなかった点(弱み7つ、同じリポジトリに): すべての記述を手作業で分類するのは最も遅く、最もサボりたくなる工程だった。自動化されなければ、来歴管理は演技に成り下がる。Markdown形式のエビデンス台帳は「この前提が崩れたら、他に何が疑わしくなるのか?」という問いに、規模が大きくなると答えられない。そして最も鋭い指摘はこれだ——この手法は、自分自身を鏡写しにしたようなアーキテクチャを推奨してしまい、自らの先入観に挑む敵対的検証の工程が存在しなかった。 我々はこれを継続的リスクとして記録し、レッドチームによる検証を必須ステップとして追加した。他のすべてを採点するシステムは、自分自身も採点可能でなければならない。
本物の仕様上の欠陥が1件見つかり(オントロジーに必要なエンティティ型が欠けていた)、新たなリスクが2件台帳に加わり、中核となる仮説2つが「仮説」から「部分的に裏付けあり」へと一段進んだ——それを裏付けた証拠とともに。
15歳でも実行できるメンタルモデル
戦略とは主張の製造工場である。あらゆる主張には裏付けが要る。裏付けの有効期限が切れたら、戦略はそれ自体で気づかなければならない。 自分の考えを変えさせるものが何かを語れない戦略は、戦略ではない。体裁を整えただけの気分だ。
エージェント型経済の観点は、これを美学の問題ではなく喫緊の課題にする。McKinsey自身のデータは、エージェント型コストが分布として振る舞うことを示している。同じタスクでもコストは最大約30倍もばらつき、エージェント型タスクのコストの約60%は、最初の回答ではなく確認と修正に費やされている。点推定のROIに基づいて組まれたAIロードマップは、構造的に誤っている。分布、テールコスト、そして較正の精度で評価される予測——これらは厳密さを飾るためのものではなく、誠実さの最低限の単位なのだ。
この先の展開
リポジトリは、あえて今は非公開のままにしてある。実装ゲート——人間が所有し、現時点では正直に「未承認」と記されている——が、仕様がいつエンジンへと姿を変えるかを決める。ゲートが開いたとき、最初の垂直スライスは一つの戦略的問いをエンドツーエンドで実行する。証拠を入力し、監査可能な戦略レポートを出力し、あらゆる数字が「なぜ?」という問いに、その根拠の連鎖で答える。
ゲートを通過できない戦略は、ただのデッキにすぎない。我々は、ゲートを先に出荷することを選ぶ。
AI-Nativeシリーズ・Paul Jialiang Wu・love12xfuture・言及されているエンゲージメントは機密情報であり、システム自体に関するあらゆる主張は、プロジェクトのゲートログと台帳で検証可能である。