SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
publication

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez
Confererence on Language Modeling (COLM), 2026
연구실 뉴스 데스크

보도 자료 요약

이 섹션은 일반 독자를 위해 의도적으로 기자 보도 자료 형식으로 작성되었습니다.

Rice University의 연구자들은 대규모 언어 모델의 사후 학습에 널리 사용되는 강화 학습 레시피에 작지만 원칙적인 변화를 준 SoftmaxGRPO를 소개했다. 이 방법은 GRPO의 알려진 약점을 겨냥한다. GRPO는 모델에게 추론을 가르치는 표준이 된 그룹 기반 목적 함수인데, 보상이 단순히 맞았는지 틀렸는지로만 주어질 때 GRPO의 그룹 내 정규화는 학습 신호의 지나치게 큰 비중을 모델이 이미 풀 수 있는 프롬프트에 쏟아붓게 되어, 배울 것이 거의 남지 않은 곳에 노력을 낭비한다. 이 문제는 요약이나 창의적 글쓰기처럼 저렴한 자동 채점기가 없어 학습이 약한 텍스트 중첩 점수에 의존해야 하는 환경에서 가장 심각하다. SoftmaxGRPO는 GRPO의 z-score 그룹 어드밴티지를, 프롬프트가 아무리 쉬워도 유계로 유지되는 temperature 스케일링된 softmax 가중치로 바꾸는 한 줄짜리 드롭인 대체물이다. 저자들은 이 변화를 이론으로 뒷받침하여, 이진 보상에 대해 그것이 최적화하는 정확한 목적 함수를 유도하고, temperature 설정이 이 방법을 REINFORCE와 유사한 동작과 최대 우도와 유사한 동작 사이에서 매끄럽게 이동시키는 방식을 보이는 한편, 더 복잡한 보상 척도에 대해서는 그러한 보장이 성립하지 않는 지점도 함께 규명한다. 동일한 조건에서 15억 파라미터 Qwen2.5 모델을 미세조정한 실험에서, SoftmaxGRPO는 거의 풀린 프롬프트로부터 그래디언트 예산을 측정 가능하게 옮겼으며(GSM8K에서는 이미 쉬운 프롬프트에 예산의 10퍼센트를 쓴 반면 GRPO는 36퍼센트를 썼다), 동일한 보상에서 GRPO를 일관되게 능가했다. 이 방법은 검증 가능한 보상으로 DeepMath 벤치마크에서 51.8퍼센트에 도달했고, 가벼운 유사도 보상만으로 Poetry 작문 점수를 35.0에서 68.0으로 끌어올렸으며, 요약, 지시 따르기, 일반 지식에 걸친 다섯 개의 검증 불가능한 벤치마크 모두에서 선두를 차지했다.

인용

@inproceedings{hernandez2026softmaxgrpo,
  title = {SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation},
  author = {Hernandez, Jefferson and Koo, Jaywon and Xiao, Zilin and Wei, Chen and Ordonez, Vicente},
  year = {2026},
  booktitle = {Confererence on Language Modeling (COLM), 2026},
  url = {https://arxiv.org/abs/2608.09271},
}

이 논문의 자동 생성된 질문, 주요 기여 및 한계

이 논문이 답하는 데 도움이 되는 질문

  • SoftmaxGRPO란 무엇이며 어떤 문제를 다루는가? SoftmaxGRPO(Softmax Advantage Group Estimation)는 GRPO 강화 학습 목적 함수를 대체하는 드롭인 대체물로, z-score로 정규화된 그룹 어드밴티지를 temperature 스케일링된 softmax 어드밴티지로 바꾼다. 이는 이진 보상 하에서 GRPO가 쉽고 이미 풀린 프롬프트에 그래디언트 신호를 집중시키는 경향을, 프롬프트별 가중치를 모든 난이도 수준에 걸쳐 유계로 유지함으로써 해결한다.
  • SoftmaxGRPO는 실제로 업데이트를 어떻게 바꾸는가? 프롬프트당 M개의 롤아웃과 보상 r_i가 주어지면, exp(r_i / tau)에 비례하는 그룹 내 가중치 w_i를 형성하고 중심화된 어드밴티지 A_i = M * w_i - 1을 만든다. 여기서 temperature tau는 보상 차이가 얼마나 날카롭게 가중치로 변환되는지를 제어한다. 실제로는 통상적인 PPO 클리핑과 참조 모델 KL 페널티로 최적화된다.
  • 이 논문이 제공하는 이론적 보장은 무엇인가? 온-폴리시 비클리핑 영역의 이진 보상에 대해서는 프롬프트 가중치가 유계인 정확한 유한 그룹 목적 함수를 유도하고 MaxRL을 그것의 저-temperature 극한으로 규명하며, 유계 스칼라 보상에 대해서는 큰 그룹 업데이트가 로그 적률생성함수 목적 함수를 정확히 최적화함을 보이는 한편, 보상 수준이 셋 이상이 되면 보편적인 유한 그룹 스칼라 유사물이 존재하지 않음을 증명한다.
  • SoftmaxGRPO는 실증적으로 GRPO에 비해 얼마나 개선되는가? 동일한 약한 유사도 보상 하에서 GSM8K에서 +7.0점, Countdown에서 +3.3점, DeepMath에서 +1.2점으로 GRPO를 개선하고, 정확한 검증기 보상으로 DeepMath에서 51.8퍼센트에 도달하며, 15억 모델의 Poetry 점수를 35.0에서 68.0으로 끌어올리는 한편, 테스트된 다섯 개의 검증 불가능한 벤치마크 모두에서 선두를 차지한다.
  • SoftmaxGRPO는 모델이 학습 노력을 쏟는 위치를 바꾸는가? 그렇다. 그래디언트 할당 측정에서 GRPO는 GSM8K 그래디언트 예산의 36.4퍼센트를 거의 풀린 프롬프트(통과율이 0.9 이상)에 배정하는 반면 SoftmaxGRPO는 10.0퍼센트를 배정하여, 개선 여지가 더 많은 어려운 예제 쪽으로 예측된 재할당이 일어남을 확인해 준다.

주요 기여

  • GRPO의 한 줄짜리 드롭인 대체물인 SoftmaxGRPO를 소개한다. 이는 z-score 그룹 어드밴티지를 temperature 스케일링된 softmax 그룹 어드밴티지로 대체하여 프롬프트 난이도 가중치를 모든 통과율에서 유계로 유지한다.
  • 이 방법이 유도하는 정확한 유한 그룹 이진 보상 목적 함수를 도출하고, MaxRL을 그것의 저-temperature 극한으로 확립하며, 유계 스칼라 보상에 대한 정확한 큰 그룹 목적 함수를 증명한다.
  • 날카로운 이론적 경계를 보인다. 보상 수준이 셋 이상이면 보상 분포에 대한 추가 가정 없이는 보편적인 유한 그룹 스칼라 목적 함수가 존재하지 않는다.
  • 통제된 ImageNet 실험을 통해, 충분한 롤아웃이 있으면 SoftmaxGRPO가 정확한 최대 우도(교차 엔트로피) 학습을 밀접하게 추적하는 반면, REINFORCE는 낮은 초기 성공률에서 진전하지 못함을 입증한다.
  • SoftmaxGRPO가 거의 풀린 프롬프트로부터 그래디언트 예산을 재할당하고, 검증 가능한 과제와 검증 불가능한 과제 모두에서 동일한 보상 하에 GRPO를 일관되게 능가함을 직접 측정으로 제공한다.

한계 및 유의 사항

  • 정확한 유한 그룹 정리는 온-폴리시 비클리핑 최적화 하의 이진 보상에 대해 확립되므로, 동일한 보장을 더 풍부한 보상 구조로 확장하는 것은 향후 연구의 자연스러운 방향이다.
  • 스칼라 보상 결과는 그룹 크기에 대해 점근적이며, 논문은 보상 수준이 셋 이상이 되면 유한 그룹 업데이트가 일반적으로 비보수적임을 신중하게 보여 주는데, 이는 깔끔한 목적 함수를 기대할 수 있는 지점과 없는 지점을 유용하게 명확히 해 준다.
  • 실용 알고리즘은 PPO 클리핑과 참조 모델 KL 정규화를 사용하는데, 저자들은 이를 정리의 일부가 아니라 정확한 온-폴리시 목적 함수에 대한 신뢰 영역 근사로 규정한다.
  • 주요 평가는 15억 파라미터 모델에 집중되므로, 더 넓은 규모의 검증이 관측된 이득이 더 큰 모델로 어떻게 이어지는지를 확인하는 데 도움이 될 것이다.
  • 검증 불가능한 결과는 불완전한 텍스트 중첩 보상과 LLM-as-a-judge 평가에 의존하며, 성능은 temperature 하이퍼파라미터에 민감하다. 따라서 현재 평가는 적응적 temperature 선택과 더 풍부한 과정 수준 보상을 시험할 여지를 남긴다.

이 결과를 읽는 방법

이 논문은 학습 신호가 프롬프트 난이도에 걸쳐 할당되는 방식의 구체적인 결함을 바로잡는, 이론적으로 근거가 있고 실증적으로 검증된 GRPO의 개선으로 읽는 것이 가장 좋다. 한 줄짜리 변화로 검증 가능한 과제와 약하게 지도되는 과제 모두에서 일관된 이득을 제공하는 한편, 가장 날카로운 보장이 연구된 15억 규모의 이진 보상에 대해 성립한다는 점을 칭찬할 만하게 명시적으로 밝힌다.