SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
Краткое изложение пресс-релиза
Исследователи из Rice University представили SoftmaxGRPO — небольшое, но принципиальное изменение широко используемого рецепта reinforcement learning для пост-обучения больших языковых моделей. Метод направлен на известную слабость GRPO — группового целевого функционала, ставшего стандартом для обучения моделей рассуждению: когда вознаграждения просто бинарны (верно или неверно), внутригрупповая нормализация GRPO в итоге направляет непропорционально большую долю обучающего сигнала на промпты, которые модель уже умеет решать, тратя усилия там, где учиться почти нечему. Эта проблема наиболее выражена в условиях без дешёвых автоматических оценщиков, таких как реферирование или творческое письмо, где обучение вынуждено опираться на слабые оценки текстового совпадения. SoftmaxGRPO — это замена в одну строку, которая меняет групповые преимущества GRPO на основе z-score на масштабируемые температурой веса softmax, остающиеся ограниченными независимо от того, насколько лёгок промпт. Авторы подкрепляют это изменение теорией, выводя точный целевой функционал, который метод оптимизирует для бинарных вознаграждений, и показывая, как настройка температуры плавно перемещает метод между поведением в духе REINFORCE и поведением в духе максимального правдоподобия, а также очерчивая, где такие гарантии перестают выполняться для более сложных шкал вознаграждений. В экспериментах по дообучению модели Qwen2.5 с 1,5 миллиарда параметров в идентичных условиях SoftmaxGRPO ощутимо перераспределил бюджет градиента от почти решённых промптов (на GSM8K он потратил 10 процентов своего бюджета на уже лёгкие промпты против 36 процентов у GRPO) и стабильно превосходил GRPO при тех же вознаграждениях. Он достиг 51,8 процента на бенчмарке DeepMath с проверяемыми вознаграждениями и поднял оценку написания Poetry с 35,0 до 68,0, используя лишь лёгкие вознаграждения по схожести, и лидировал на каждом из пяти непроверяемых бенчмарков, охватывающих реферирование, следование инструкциям и общие знания.
цитирование
@inproceedings{hernandez2026softmaxgrpo,
title = {SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation},
author = {Hernandez, Jefferson and Koo, Jaywon and Xiao, Zilin and Wei, Chen and Ordonez, Vicente},
year = {2026},
booktitle = {Confererence on Language Modeling (COLM), 2026},
url = {https://arxiv.org/abs/2608.09271},
}
автоматически сгенерированные вопросы, основные вклады и ограничения этой статьи
Вопросы, на которые помогает ответить эта статья
- Что такое SoftmaxGRPO и какую проблему он решает? SoftmaxGRPO (Softmax Advantage Group Estimation) — это замена целевого функционала reinforcement learning GRPO, которая заменяет нормализованные по z-score групповые преимущества на масштабируемые температурой преимущества softmax; он устраняет свойственную GRPO при бинарных вознаграждениях склонность концентрировать сигнал градиента на лёгких, уже решённых промптах, сохраняя веса каждого промпта ограниченными на всех уровнях сложности.
- Как именно SoftmaxGRPO меняет обновление? Имея M роллаутов на промпт с вознаграждениями r_i, он формирует внутригрупповые веса w_i, пропорциональные exp(r_i / tau), и центрированные преимущества A_i = M * w_i - 1, где температура tau управляет тем, насколько резко различия вознаграждений преобразуются в веса; на практике он оптимизируется с обычным клиппингом PPO и штрафом KL относительно референсной модели.
- Какие теоретические гарантии даёт статья? Для бинарных вознаграждений в on-policy режиме без клиппинга она выводит точный целевой функционал для конечной группы с ограниченными весами промптов и определяет MaxRL как его предел при низкой температуре, а для ограниченных скалярных вознаграждений показывает, что обновление для большой группы точно оптимизирует целевой функционал на основе логарифма производящей функции моментов, доказывая при этом, что никакого универсального скалярного аналога для конечной группы не существует, как только уровней вознаграждения становится три или более.
- Насколько SoftmaxGRPO эмпирически превосходит GRPO? При идентичных слабых вознаграждениях по схожести он превосходит GRPO на +7,0 балла на GSM8K, +3,3 на Countdown и +1,2 на DeepMath, достигает 51,8 процента на DeepMath с точными вознаграждениями верификатора и поднимает оценку Poetry у модели на 1,5B с 35,0 до 68,0, лидируя при этом на всех пяти протестированных непроверяемых бенчмарках.
- Меняет ли SoftmaxGRPO то, на что модель тратит усилия обучения? Да; измерение распределения градиента показывает, что GRPO выделяет 36,4 процента своего бюджета градиента на GSM8K почти решённым промптам (доля успеха 0,9 или выше) против 10,0 процента у SoftmaxGRPO, что подтверждает предсказанное перераспределение в сторону более сложных примеров с большим потенциалом для улучшения.
Основные вклады
- Представляет SoftmaxGRPO — замену GRPO в одну строку, которая ставит масштабируемые температурой групповые преимущества softmax вместо групповых преимуществ на основе z-score, сохраняя веса по сложности промптов ограниченными при всех долях успеха.
- Выводит точный целевой функционал для конечной группы при бинарных вознаграждениях, порождаемый методом, устанавливает MaxRL как его предел при низкой температуре и доказывает точный целевой функционал для большой группы при ограниченных скалярных вознаграждениях.
- Показывает чёткую теоретическую границу: при трёх или более уровнях вознаграждения не существует универсального скалярного целевого функционала для конечной группы без дополнительных предположений о распределении вознаграждений.
- Демонстрирует на контролируемом эксперименте с ImageNet, что при достаточном числе роллаутов SoftmaxGRPO близко следует за точным обучением по максимуму правдоподобия (перекрёстная энтропия) там, где REINFORCE не может продвинуться от низких начальных долей успеха.
- Приводит прямые измерения того, что SoftmaxGRPO перераспределяет бюджет градиента от почти решённых промптов и стабильно превосходит GRPO при идентичных вознаграждениях как на проверяемых, так и на непроверяемых задачах.
Ограничения и предостережения
- Точная теорема для конечной группы установлена для бинарных вознаграждений при on-policy оптимизации без клиппинга, поэтому распространение тех же гарантий на более богатые структуры вознаграждений — естественное направление для будущей работы.
- Результат для скалярных вознаграждений асимптотичен по размеру группы, и статья аккуратно показывает, что обновление для конечной группы в общем случае неконсервативно, как только вознаграждения принимают три или более уровня, что полезно проясняет, где можно и где нельзя ожидать чистого целевого функционала.
- Практический алгоритм использует клиппинг PPO и KL-регуляризацию относительно референсной модели, что авторы представляют как приближение доверительной области к точному on-policy целевому функционалу, а не как часть самой теоремы.
- Основные оценки сосредоточены на модели с 1,5 миллиарда параметров, поэтому проверка на более широком масштабе помогла бы подтвердить, как наблюдаемые улучшения переносятся на более крупные модели.
- Непроверяемые результаты опираются на несовершенные вознаграждения текстового совпадения и оценку по схеме LLM-as-a-judge, а производительность чувствительна к гиперпараметру температуры, поэтому текущая оценка оставляет простор для проверки адаптивного выбора температуры и более богатых вознаграждений на уровне процесса.
Как интерпретировать этот результат
Эту статью лучше всего воспринимать как теоретически обоснованное и эмпирически подтверждённое улучшение GRPO, которое устраняет конкретный изъян в том, как обучающий сигнал распределяется по сложности промптов, обеспечивая стабильный прирост как на проверяемых, так и на слабо контролируемых задачах изменением в одну строку, при этом похвально прямо указывая, что его самые сильные гарантии выполняются для бинарных вознаграждений на изученном масштабе 1,5B.