AI-Native シリーズ・強化学習
The Scale Furnace
1分でわかる要点——ここから持ち帰れるもの
スケールが大きくなると、RLアルゴリズムは派手に失敗しなくなる。代わりに静かに失敗し始めるのだ。方策のエントロピーは単調に低下し、サンプリングされた出力は互いに収束していき、探索は終わる——それでいて損失曲線はずっと滑らかなままだ。やがてグループは同一の報酬ばかりを返すようになり、std(r)がゼロになり、アドバンテージもゼロになり、勾配は消える。損失関数の中のすべての分母は、その裏でどの事例を重視するかを決めている。Dr.GRPOは、GRPOの長さ正規化が特に誤った回答の長さを水増ししていること、そしてstd(r)で割ることが低分散の問題を過大評価してしまうことを発見した [2]。DAPOは上側のクリッピング境界を引き上げ、死んだグループを再サンプリングすることで、AIME 2024で47に対して50を、しかも訓練ステップ数を半分に抑えて達成した[1]。RLの学習を回すときにログを一つ余分に取るなら、エントロピーを取れ。損失は何も教えてくれない。
最初の3話はすべて、アルゴリズムこそが難所だという前提に立っていた。だがスケールした環境ではそうではない。スケールした環境での難所は、何も間違って見えないまま学習が止まりうる.
たった一つの発想:静かな失敗には3つの形がある
エントロピー崩壊。 方策エントロピー——モデルの確率分布がどれだけ広がっているか——は訓練を通じて単調に減少していく。サンプリングされた出力はほぼ同一の解へと収束していく。方策が本来見つけられたはずの戦略を発見する前に、探索は終わってしまう。ランは崩壊しない。ただ静かに何も発見しなくなるだけだ。それがより厄介なのは、損失曲線は依然として健全に見えるからだ。
分散ゼロのグループ。 GRPOはアドバンテージを、兄弟関係にあるロールアウトのグループから計算する。もしすべての兄弟が同じ報酬を得たなら——簡単なプロンプトで全員正解、難しいプロンプトで全員不正解——標準偏差はゼロになり、アドバンテージもゼロになり、そのグループ全体が勾配に対して何も貢献しなかったことになる。それでも計算コストは満額支払い済みだ。
分母。 損失関数の中の正規化項はすべて、どの事例を重視するかについての決定であり、それはほぼ間違いなく、そのような決定を下すつもりなど毛頭なかった誰かが、数値計算上の都合だけで選んだものだ。
数字を読む
DAPOは2つの介入を組み合わせている [1]。Clip-Higher は上限と下限のクリッピング境界を切り離し、上限を引き上げることで、低確率の探索的トークンが抑制されないようにする——対称的なクリッピングの下では、これらのトークンの比率が最も大きく動くため、真っ先に潰されてしまう。Dynamic Sampling は、グループ内のすべてのロールアウトが同じ報酬しか得られなかったプロンプトを再サンプリングする。つまり、勾配を生み出せないグループに計算コストを費やすことを拒否するわけだ。
その結果——AIME 2024で50点(Qwen2.5-32Bを使用)に対し、47DeepSeek-R1-Zero-Qwen-32Bでは47点、しかも訓練ステップは50%で済んだ。 [1].
よく読んでほしい。興味深い数字は50ではない。3ポイントの精度差もひとつの論拠にはなる。だが、そこに至るまでの計算量が半分で済んだこと——それこそが本当の発見だ。 この介入はモデルを賢くしたわけではない。オプティマイザが自らの勾配シグナルを捨ててしまうのを止めただけだ。
もう一段深いメカニズム:分母とは価値判断そのものである
Dr.GRPO [2] は標準的なGRPOに二つの異なるバイアスがあることを発見した。両者は逆方向に作用するため、正確に述べておく価値がある。
長さバイアス。 長さ正規化は、誤った 応答の長さを特に膨らませてしまう。モデルは間違っているときほど長く書くことを学習する——誰も意図していないこととは正反対の現象であり、ダッシュボード上では「モデルがより深く推論している」ように見えてしまう。
応答レベルの難易度バイアス。 アドバンテージを std(r) で割ると、たまたまロールアウトの分散が小さかった問題の重みが過大になる。Dr.GRPOはこのスケーリングを取り除き、すべての問題を等しく扱う。
両方の項を取り除いた結果、Math-7Bで最先端の性能を達成した——8×A100で27時間 [2]——この数字は記憶にとどめる価値がある。この種の修正が意味するのは補正であって、スケールアップではないということだからだ。
この教訓はこの論文を超えて広く一般化する。 損失関数に含まれるすべての分母は、どの例が重要かについての方針的判断であるが、その判断を書き残す者は誰もいない。
先を読む前に予測してみよう
標準的なGRPOは各アドバンテージをグループの報酬の標準偏差で割り、さらに損失を応答長で正規化する。どちらも一見ふつうの数値上の衛生処理だ。だがそのうちの一つは、学習ログにはっきりと目に見える特定の病理を生む。それはどちらで、どんな見た目になるか?
(a) 長さの正規化は正しい答えを短くする。(b) 長さの正規化は誤った答えを長くする。(c) std正規化は難しい問題を支配的にする。(d) std正規化は分散の低い問題を支配的にする。
このうち二つが正しいが、それは多くの人が選ぶ二つではない。
失敗の部屋:探索のつまみを間違った方向に回す
正常に動いているGRPOのランを一つだけ変えてみる——上限クリッピング境界を、引き上げる代わりに締め付けるのだ。上限クリッピング境界を、引き上げる代わりに締め付ける。
壊れる順序はこうだ——低確率トークンが最も強く抑制され、エントロピーがベースラインより速く低下し、グループ内の補完が互いにそっくりになり始め、std(r)がゼロになり、アドバンテージがゼロになり、そしてその間ずっと、損失曲線は完全に健全に見え続ける.
この最後のステップこそが肝心だ。エラーもスパイクもNaNもない。何千ステップも前に学習を止めたモデルにしては、なめらかでプロフェッショナルに見える曲線が続くだけだ。
RLの学習で追加のスカラーをひとつだけログするなら、方策エントロピーを記録せよ。 ふたつログできるなら、報酬の分散がゼロになったグループの割合も記録せよ——それは勾配が消えていく様子そのものだ。
リアリティ・ミッション
今週実行する訓練ループや評価ループを何でもいいから選んでほしい——RLの実行でも、ファインチューニングでも、夜間ベンチマークでもいい。そこにあるすべての分母を見つけ出し、それが「どの例が重要か」について何を語っているかを書き出してみる。
トークン単位の平均を取っているなら、それは長い例のほうが重要だと決めたことになる。シーケンス単位の平均を取っているなら、すべて等しく重要だと決めたことになる。どこかで標準偏差による除算をしているなら、分散の低いケースのほうが重要だと決めたことになるが、そんなつもりはまずなかったはずだ。正当化できないものが少なくともひとつは見つかるだろう。
正直に言おう、これには代償がある
定数は転用できない。 DAPOのクリッピング境界は、あのモデル、あのタスク群、あのシーケンス長のために調整されたものだ。メカニズムは再利用できるが、数値はそうではない。
これらの修正は互いに干渉する。 Clip-Higher、動的サンプリング、そして変更された分母——これらはすべて探索に影響を及ぼす。積み重ねても効果は単純に加算されるわけではなく、論文はたいていそれぞれを単独で報告しているだけだ。
そして、たった一回の実行は測定にはならない。 このエピソードに出てくる数値はすべて特定の設定から得られたものであり、それが手元の環境で再現するかどうかは、自分で実験して確かめるしかない。しかも、主張する効果を検出できるだけの十分な数のシードを使ってだ。
この先の展開
第5話が扱うのは、生成結果がテキストであることをやめ、応答してくる世界を通り抜ける軌跡になる瞬間だ——ハーネスが方策を取り巻く単なる足場であることをやめ、方策そのものの一部になる瞬間でもある。
Intelligence Engineering Adventures, Season 1 — The Consequence Engine 第4話(全5話)。このシリーズの出典における主張には、定義・導出・エビデンス・エンジニアリング上の選択・未解決の問い、というクラス別のタグが付けられている。また、メタファーはある主張を導入することはあっても、その証拠として使われることはない。各エピソードにはCPUで実行可能なラボが付属する。この記事にはいかなる雇用主・クライアントの資料も含まれていない。——Paul Jialiang Wu・agentic-portfolio-lovat.vercel.app
参考文献
- Yu, Q. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale.(訳:DAPO——大規模なオープンソースLLM強化学習システム) Clip-HigherとDynamic Sampling;Qwen2.5-32BによるAIME 2024で50点、DeepSeek-R1-Zero-Qwen-32Bの47点に対し、訓練ステップ数は50%。arxiv.org/abs/2503.14476
- Liu, Z. et al. (2025). Understanding R1-Zero-Like Training: A Critical Perspective(Dr.GRPO)。長さバイアスと std 正規化による難易度バイアス。Math-7B で 8×A100 を用いて27時間で最先端を達成。 arxiv.org/abs/2503.20783
- Zheng, C. et al. (2025). Group Sequence Policy Optimization(GSPO)。MoE モデルと長文推論のためのシーケンスレベル重要度比。 arxiv.org/abs/2507.18071
- Chen, A. et al. (2025). MiniMax-M1(CISPO)。更新ではなく重要度サンプリング重みをクリッピングする。 arxiv.org/abs/2506.13585
- Shao, Z. et al. (2024). DeepSeekMath(GRPO)。上記すべてが修正対象としているアルゴリズム。 arxiv.org/abs/2402.03300
- Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. 今回のエピソードが分離するクリッピング。 arxiv.org/abs/1707.06347