SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
publication

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez
Confererence on Language Modeling (COLM), 2026
Mesa de notícias do laboratório

Resumo do comunicado de imprensa

Esta seção foi escrita intencionalmente em tom de comunicado de imprensa, em estilo jornalístico, para o público geral.

Pesquisadores da Rice University apresentaram o SoftmaxGRPO, uma mudança pequena mas fundamentada em uma receita de aprendizado por reforço amplamente utilizada para o pós-treinamento de grandes modelos de linguagem. O método aborda uma fraqueza conhecida do GRPO, o objetivo baseado em grupos que se tornou padrão para ensinar modelos a raciocinar: quando as recompensas são simplesmente certo-ou-errado, a normalização dentro do grupo do GRPO acaba despejando uma parcela desproporcional do sinal de aprendizado em prompts que o modelo já consegue resolver, desperdiçando esforço onde há pouco a aprender. Esse problema é pior em cenários sem avaliadores automáticos baratos, como sumarização ou escrita criativa, onde o treinamento precisa depender de pontuações fracas de sobreposição de texto. O SoftmaxGRPO é uma substituição direta de uma linha que troca as vantagens de grupo por z-score do GRPO por pesos softmax escalonados por temperatura, que permanecem limitados por mais fácil que seja um prompt. Os autores fundamentam a mudança com teoria, derivando o objetivo exato que ele otimiza para recompensas binárias e mostrando como um ajuste de temperatura move suavemente o método entre um comportamento semelhante ao REINFORCE e um semelhante à máxima verossimilhança, além de delinear onde essas garantias deixam de valer para escalas de recompensa mais complexas. Em experimentos de ajuste fino de um modelo Qwen2.5 de 1,5 bilhão de parâmetros sob condições idênticas, o SoftmaxGRPO deslocou de forma mensurável o orçamento de gradiente para longe de prompts quase resolvidos (no GSM8K, gastou 10 por cento de seu orçamento em prompts já fáceis contra os 36 por cento do GRPO) e superou consistentemente o GRPO com as mesmas recompensas. Ele atingiu 51,8 por cento no benchmark DeepMath com recompensas verificáveis e elevou uma pontuação de escrita de Poetry de 35,0 para 68,0 usando apenas recompensas leves de similaridade, e liderou cada um dos cinco benchmarks não verificáveis abrangendo sumarização, seguimento de instruções e conhecimento geral.

citação

@inproceedings{hernandez2026softmaxgrpo,
  title = {SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation},
  author = {Hernandez, Jefferson and Koo, Jaywon and Xiao, Zilin and Wei, Chen and Ordonez, Vicente},
  year = {2026},
  booktitle = {Confererence on Language Modeling (COLM), 2026},
  url = {https://arxiv.org/abs/2608.09271},
}

perguntas, principais contribuições e limitações deste artigo geradas automaticamente

Perguntas que este artigo ajuda a responder

  • O que é o SoftmaxGRPO e qual problema ele resolve? O SoftmaxGRPO (Softmax Advantage Group Estimation) é uma substituição direta do objetivo de aprendizado por reforço GRPO que troca as vantagens de grupo normalizadas por z-score por vantagens softmax escalonadas por temperatura; ele aborda a tendência do GRPO, sob recompensas binárias, de concentrar o sinal de gradiente em prompts fáceis, já resolvidos, mantendo o peso por prompt limitado em todos os níveis de dificuldade.
  • Como o SoftmaxGRPO realmente altera a atualização? Dados M rollouts por prompt com recompensas r_i, ele forma pesos dentro do grupo w_i proporcionais a exp(r_i / tau) e vantagens centradas A_i = M * w_i - 1, onde a temperatura tau controla quão acentuadamente as diferenças de recompensa são convertidas em pesos; na prática, ele é otimizado com o clipping usual do PPO e uma penalidade de KL do modelo de referência.
  • Quais garantias teóricas o artigo fornece? Para recompensas binárias no regime on-policy sem clipping, ele deriva um objetivo exato de grupo finito com peso de prompt limitado e identifica o MaxRL como seu limite de baixa temperatura, e para recompensas escalares limitadas ele mostra que a atualização de grupo grande otimiza exatamente um objetivo de função geradora de log-momentos, ao mesmo tempo em que prova que não existe um análogo escalar universal de grupo finito quando há três ou mais níveis de recompensa.
  • Quanto o SoftmaxGRPO melhora em relação ao GRPO empiricamente? Sob recompensas de similaridade fracas idênticas, ele melhora em relação ao GRPO em +7,0 pontos no GSM8K, +3,3 no Countdown e +1,2 no DeepMath, atinge 51,8 por cento no DeepMath com recompensas de verificador exatas e eleva a pontuação de Poetry de um modelo de 1,5B de 35,0 para 68,0, ao mesmo tempo em que lidera todos os cinco benchmarks não verificáveis testados.
  • O SoftmaxGRPO muda onde o modelo gasta seu esforço de aprendizado? Sim; uma medição de alocação de gradiente mostra que o GRPO atribui 36,4 por cento de seu orçamento de gradiente do GSM8K a prompts quase resolvidos (taxa de acerto igual ou acima de 0,9) contra 10,0 por cento para o SoftmaxGRPO, confirmando a realocação prevista em direção a exemplos mais difíceis com mais margem para melhorar.

Principais contribuições

  • Introduz o SoftmaxGRPO, uma substituição direta de uma linha para o GRPO que substitui as vantagens de grupo softmax escalonadas por temperatura pelas vantagens de grupo por z-score, mantendo o peso da dificuldade do prompt limitado em todas as taxas de acerto.
  • Deriva o objetivo exato de recompensa binária de grupo finito induzido pelo método, estabelece o MaxRL como seu limite de baixa temperatura e prova um objetivo exato de grupo grande para recompensas escalares limitadas.
  • Mostra uma fronteira teórica nítida: com três ou mais níveis de recompensa, não existe um objetivo escalar universal de grupo finito sem suposições adicionais sobre a distribuição da recompensa.
  • Demonstra por meio de um experimento controlado no ImageNet que, com rollouts suficientes, o SoftmaxGRPO acompanha de perto o treinamento exato de máxima verossimilhança (entropia cruzada), onde o REINFORCE não consegue progredir a partir de baixas taxas de sucesso iniciais.
  • Fornece medições diretas de que o SoftmaxGRPO realoca o orçamento de gradiente para longe de prompts quase resolvidos e supera consistentemente o GRPO sob recompensas idênticas tanto em tarefas verificáveis quanto não verificáveis.

Limitações e ressalvas

  • O teorema exato de grupo finito é estabelecido para recompensas binárias sob otimização on-policy sem clipping, de modo que estender as mesmas garantias a estruturas de recompensa mais ricas é uma direção natural para trabalhos futuros.
  • O resultado de recompensa escalar é assintótico no tamanho do grupo, e o artigo tem o cuidado de mostrar que a atualização de grupo finito é geralmente não conservadora quando as recompensas assumem três ou mais níveis, o que esclarece de forma útil onde um objetivo limpo pode e não pode ser esperado.
  • O algoritmo prático usa o clipping do PPO e a regularização de KL do modelo de referência, que os autores enquadram como uma aproximação de região de confiança do objetivo on-policy exato, em vez de parte do próprio teorema.
  • As principais avaliações se concentram em um modelo de 1,5 bilhão de parâmetros, portanto uma validação em escala mais ampla ajudaria a confirmar como os ganhos observados se transferem para modelos maiores.
  • Os resultados não verificáveis dependem de recompensas imperfeitas de sobreposição de texto e da avaliação por LLM-as-a-judge, e o desempenho é sensível ao hiperparâmetro de temperatura, de modo que a avaliação atual deixa margem para testar a seleção adaptativa de temperatura e recompensas de nível de processo mais ricas.

Como interpretar este resultado

Este artigo é mais bem lido como um refinamento do GRPO, fundamentado teoricamente e validado empiricamente, que corrige uma falha concreta na forma como o sinal de aprendizado é alocado ao longo da dificuldade dos prompts, entregando ganhos consistentes tanto em tarefas verificáveis quanto fracamente supervisionadas com uma mudança de uma linha, ao mesmo tempo em que é louvavelmente explícito ao afirmar que suas garantias mais nítidas valem para recompensas binárias na escala de 1,5B estudada.