SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
publication

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez
Confererence on Language Modeling (COLM), 2026
实验室新闻台

新闻稿摘要

本节特意采用记者式新闻稿的语气,面向普通读者撰写。

Rice University 的研究者提出了 SoftmaxGRPO,这是对一种被广泛使用、用于大语言模型后训练的强化学习方案所做的一处微小但有原则的改动。该方法针对 GRPO 的一个已知弱点。GRPO 是一种基于分组的目标函数,已成为训练模型进行推理的标准做法:当奖励只是简单的对或错时,GRPO 的组内归一化最终会把过大比例的学习信号灌注到模型已经能够解决的提示上,在几乎没有东西可学的地方浪费精力。这一问题在缺乏廉价自动评分器的场景中最为严重,例如摘要或创意写作,此时训练必须依赖较弱的文本重叠分数。SoftmaxGRPO 是一种只需一行代码的即插即用替代方案,它用经 temperature 缩放的 softmax 权重替换 GRPO 的 z-score 组优势,无论提示多么简单,这些权重都保持有界。作者用理论支撑这一改动,推导出它在二元奖励下所优化的精确目标,并展示了 temperature 的取值如何使该方法在类似 REINFORCE 的行为与类似最大似然的行为之间平滑过渡,同时也刻画了在更复杂的奖励尺度下这类保证在何处不再成立。在相同条件下对一个 15 亿参数的 Qwen2.5 模型进行微调的实验中,SoftmaxGRPO 明显地将梯度预算从接近解决的提示上转移开(在 GSM8K 上,它将 10% 的预算花在已经简单的提示上,而 GRPO 为 36%),并在相同奖励下始终优于 GRPO。在使用可验证奖励时,它在 DeepMath 基准上达到了 51.8%,并且仅使用轻量的相似度奖励就将 Poetry 写作分数从 35.0 提高到 68.0,而且在涵盖摘要、指令遵循与常识的五个不可验证基准上均名列第一。

引用

@inproceedings{hernandez2026softmaxgrpo,
  title = {SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation},
  author = {Hernandez, Jefferson and Koo, Jaywon and Xiao, Zilin and Wei, Chen and Ordonez, Vicente},
  year = {2026},
  booktitle = {Confererence on Language Modeling (COLM), 2026},
  url = {https://arxiv.org/abs/2608.09271},
}

自动生成的本文相关问题、主要贡献与局限

本文有助于回答的问题

  • SoftmaxGRPO 是什么,它解决了什么问题?SoftmaxGRPO(Softmax Advantage Group Estimation)是 GRPO 强化学习目标的即插即用替代方案,它用经 temperature 缩放的 softmax 优势替换 z-score 归一化的组优势;通过在所有难度级别上都保持逐提示权重有界,它解决了 GRPO 在二元奖励下将梯度信号集中到简单、已经解决的提示上的倾向。
  • SoftmaxGRPO 究竟如何改变更新?给定每个提示的 M 次 rollout 及其奖励 r_i,它构造与 exp(r_i / tau) 成正比的组内权重 w_i,以及中心化优势 A_i = M * w_i - 1,其中 temperature tau 控制奖励差异被转换为权重的锐利程度;在实践中,它使用常规的 PPO 裁剪和参考模型 KL 惩罚进行优化。
  • 论文提供了哪些理论保证?对于同策略(on-policy)无裁剪情形下的二元奖励,它推导出一个具有有界提示权重的精确有限组目标,并将 MaxRL 识别为其低 temperature 极限;对于有界的标量奖励,它表明大组更新精确地优化了一个对数矩生成函数目标,同时证明一旦存在三个或更多奖励级别,就不存在通用的有限组标量对应物。
  • 在实证上 SoftmaxGRPO 相比 GRPO 提升了多少?在相同的弱相似度奖励下,它在 GSM8K 上比 GRPO 提升 +7.0 分,在 Countdown 上提升 +3.3,在 DeepMath 上提升 +1.2,在使用精确验证器奖励时在 DeepMath 上达到 51.8%,并将一个 1.5B 模型的 Poetry 分数从 35.0 提高到 68.0,同时在所测试的全部五个不可验证基准上均名列前茅。
  • SoftmaxGRPO 是否改变了模型投入学习精力的位置?是的;一项梯度分配测量显示,GRPO 将其 GSM8K 梯度预算的 36.4% 分配给接近解决的提示(通过率达到或超过 0.9),而 SoftmaxGRPO 为 10.0%,这证实了预测中向有更多改进空间的更难样本的重新分配。

主要贡献

  • 提出 SoftmaxGRPO,这是 GRPO 的一种只需一行代码的即插即用替代方案,它以经 temperature 缩放的 softmax 组优势替代 z-score 组优势,使提示难度权重在所有通过率下都保持有界。
  • 推导出该方法所导出的精确有限组二元奖励目标,确立 MaxRL 为其低 temperature 极限,并为有界标量奖励证明了一个精确的大组目标。
  • 揭示了一个明确的理论边界:在三个或更多奖励级别下,若不对奖励分布作额外假设,就不存在通用的有限组标量目标。
  • 通过一个受控的 ImageNet 实验表明,在有足够 rollout 的情况下,SoftmaxGRPO 能紧密贴合精确的最大似然(交叉熵)训练,而 REINFORCE 则无法从较低的初始成功率上取得进展。
  • 提供了直接测量,表明 SoftmaxGRPO 将梯度预算从接近解决的提示上重新分配开来,并在可验证与不可验证任务中,在相同奖励下始终优于 GRPO。

局限与注意事项

  • 精确的有限组定理是在同策略无裁剪优化下针对二元奖励建立的,因此将同样的保证扩展到更丰富的奖励结构是未来工作的一个自然方向。
  • 标量奖励的结果在组规模上是渐近的,论文谨慎地表明,一旦奖励取三个或更多级别,有限组更新通常是非保守的,这有益地阐明了在何处可以以及不可以期待一个干净的目标。
  • 实际算法使用 PPO 裁剪和参考模型 KL 正则化,作者将其视为对精确同策略目标的信任域近似,而非定理本身的一部分。
  • 主要评估集中于一个 15 亿参数的模型,因此更大规模的验证将有助于确认所观察到的收益如何延续到更大的模型。
  • 不可验证的结果依赖于不完美的文本重叠奖励和 LLM-as-a-judge 评估,且性能对 temperature 超参数敏感,因此当前评估仍有空间去测试自适应 temperature 选择和更丰富的过程级奖励。

如何理解这一结果

这篇论文最好被理解为对 GRPO 的一次有理论基础且经过实证验证的改进,它修复了学习信号如何在提示难度间分配的一个具体缺陷,仅用一行改动便在可验证与弱监督任务上带来一致的收益,同时值得称道地明确指出其最尖锐的保证适用于所研究的 1.5B 规模下的二元奖励。