プレスリリース要約
Rice University の研究者らは、大規模言語モデルのポストトレーニングに広く用いられている強化学習のレシピに対する、小さいながらも原理に基づいた変更である SoftmaxGRPO を提案しました。この手法は、モデルに推論を教えるための標準的な手法となったグループベースの目的関数 GRPO の既知の弱点を対象としています。報酬が単純に正解か不正解かである場合、GRPO のグループ内正規化は、モデルがすでに解ける プロンプト に不釣り合いなほど大きな割合の学習信号を注ぎ込んでしまい、学ぶべきことがほとんど残っていないところで労力を浪費してしまいます。この問題は、要約や創作のように安価な自動採点器がない設定で最も深刻であり、そうした設定では学習が弱いテキスト重複スコアに頼らざるを得ません。SoftmaxGRPO は一行で差し替えられる手法であり、GRPO の z-score グループアドバンテージを、プロンプト がどれほど簡単であっても有界に保たれる temperature でスケールされた softmax の重みに置き換えます。著者らはこの変更を理論で裏付けており、二値報酬に対して最適化される厳密な目的関数を導出し、temperature の設定によって手法が REINFORCE 的な挙動と最尤法的な挙動の間を滑らかに移行する様子を示すとともに、より複雑な報酬スケールに対してそうした保証が成り立たなくなる箇所も明らかにしています。同一条件下で 15 億パラメータの Qwen2.5 モデルを ファインチューニング する実験では、SoftmaxGRPO は 勾配 の予算をほぼ解けている プロンプト から測定可能なほど移し(GSM8K では予算の 10 パーセントをすでに簡単な プロンプト に費やしたのに対し、GRPO は 36 パーセントでした)、同じ報酬のもとで一貫して GRPO を上回りました。検証可能な報酬を用いた DeepMath ベンチマーク では 51.8 パーセントに到達し、軽量な類似度報酬のみを用いて Poetry の作文スコアを 35.0 から 68.0 へと引き上げ、要約・指示追従・一般知識にまたがる 5 つの検証不能な ベンチマーク のすべてで首位となりました。
引用
@inproceedings{hernandez2026softmaxgrpo,
title = {SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation},
author = {Hernandez, Jefferson and Koo, Jaywon and Xiao, Zilin and Wei, Chen and Ordonez, Vicente},
year = {2026},
booktitle = {Confererence on Language Modeling (COLM), 2026},
url = {https://arxiv.org/abs/2608.09271},
}
この論文について自動生成された質問、主な貢献、および限界
この論文が答える助けとなる質問
- SoftmaxGRPO とは何であり、どのような問題に対処するのか。SoftmaxGRPO(Softmax Advantage Group Estimation)は、GRPO の強化学習の目的関数を差し替える手法であり、z-score で正規化されたグループアドバンテージを temperature でスケールされた softmax アドバンテージに置き換えます。これは、二値報酬のもとで GRPO が 勾配 の信号を簡単ですでに解けている プロンプト に集中させてしまう傾向に対処するもので、プロンプト ごとの重み付けをあらゆる難易度にわたって有界に保ちます。
- SoftmaxGRPO は更新を実際にどのように変えるのか。プロンプト ごとに報酬 r_i を持つ M 個のロールアウトが与えられると、exp(r_i / tau) に比例するグループ内の重み w_i と、中心化されたアドバンテージ A_i = M * w_i - 1 を構成します。ここで temperature の tau は、報酬の差をどれほど鋭く重みに変換するかを制御します。実際には、通常の PPO クリッピングと参照モデルの KL ペナルティを用いて最適化されます。
- この論文はどのような理論的保証を提供するのか。オンポリシーでクリッピングなしの領域における二値報酬について、有界な プロンプト の重み付けを伴う厳密な有限グループの目的関数を導出し、その低 temperature 極限として MaxRL を同定します。また、有界なスカラー報酬については、大規模グループの更新が対数モーメント母関数の目的関数を厳密に最適化することを示す一方で、報酬の水準が 3 つ以上になると普遍的な有限グループのスカラー版が存在しないことを証明しています。
- SoftmaxGRPO は経験的に GRPO をどれだけ改善するのか。同一の弱い類似度報酬のもとで、GSM8K で GRPO を +7.0 ポイント、Countdown で +3.3、DeepMath で +1.2 上回り、厳密な検証器報酬を用いた DeepMath で 51.8 パーセントに到達し、15 億パラメータのモデルの Poetry スコアを 35.0 から 68.0 へと引き上げるとともに、検証された 5 つの検証不能な ベンチマーク のすべてで首位となりました。
- SoftmaxGRPO はモデルが学習の労力を費やす場所を変えるのか。はい。勾配 の配分の測定によると、GRPO は GSM8K の 勾配 予算の 36.4 パーセントをほぼ解けている プロンプト(合格率が 0.9 以上)に割り当てるのに対し、SoftmaxGRPO は 10.0 パーセントであり、改善の余地がより大きい難しい事例へと再配分されるという予測を裏付けています。
主な貢献
- GRPO を一行で差し替えられる手法である SoftmaxGRPO を提案し、z-score グループアドバンテージを temperature でスケールされた softmax グループアドバンテージに置き換えることで、プロンプト の難易度に対する重み付けをあらゆる合格率で有界に保ちます。
- この手法によって導かれる厳密な有限グループの二値報酬の目的関数を導出し、その低 temperature 極限として MaxRL を確立するとともに、有界なスカラー報酬に対する厳密な大規模グループの目的関数を証明します。
- 鋭い理論的境界を示します。報酬の水準が 3 つ以上ある場合、報酬分布に関する追加の仮定なしには普遍的な有限グループのスカラー目的関数は存在しません。
- 制御された ImageNet の実験を通じて、十分なロールアウトがあれば、REINFORCE が低い初期成功率から進展できない場面でも、SoftmaxGRPO が厳密な最尤法(交差エントロピー)による学習に密接に追随することを実証します。
- SoftmaxGRPO が 勾配 の予算をほぼ解けている プロンプト から再配分し、検証可能なタスクと検証不能なタスクの双方にわたって同一の報酬のもとで一貫して GRPO を上回ることを直接測定によって示します。
限界と注意点
- 厳密な有限グループの定理は、オンポリシーでクリッピングなしの最適化のもとでの二値報酬について確立されているため、同じ保証をより豊かな報酬構造へと拡張することは今後の研究の自然な方向性です。
- スカラー報酬の結果はグループサイズに関して漸近的であり、論文は報酬が 3 つ以上の水準を取ると有限グループの更新が一般に非保守的になることを丁寧に示しており、これはきれいな目的関数が期待できる箇所とできない箇所を有益に明確化しています。
- 実用的なアルゴリズムは PPO クリッピングと参照モデルの KL 正則化を用いており、著者らはこれを定理そのものの一部ではなく、厳密なオンポリシーの目的関数に対する信頼領域の近似として位置づけています。
- 主要な評価は 15 億パラメータのモデルに焦点を当てているため、より広い規模での検証は、観測された利得がより大きなモデルにどのように波及するかを確認するのに役立つでしょう。
- 検証不能な結果は不完全なテキスト重複報酬と LLM-as-a-judge による評価に依存しており、性能は temperature のハイパーパラメータに敏感であるため、現在の評価は適応的な temperature の選択やより豊かなプロセス水準の報酬を検証する余地を残しています。
この結果の読み解き方
本論文は、学習信号が プロンプト の難易度にわたってどのように配分されるかにおける具体的な欠陥を修正する、理論的に裏付けられ経験的に検証された GRPO の改良として読むのが最も適切です。一行の変更で検証可能なタスクと弱教師付きのタスクの双方に一貫した利得をもたらす一方で、その最も鋭い保証が研究対象である 15 億規模での二値報酬について成り立つことを称賛に値するほど明確に述べています。