SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
publication

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez
Confererence on Language Modeling (COLM), 2026
Bàn tin tức của phòng thí nghiệm

Tóm tắt thông cáo báo chí

Phần này được viết có chủ đích theo giọng văn thông cáo báo chí kiểu nhà báo, dành cho độc giả phổ thông.

Các nhà nghiên cứu tại Rice University đã giới thiệu SoftmaxGRPO, một thay đổi nhỏ nhưng có nguyên tắc đối với một công thức học tăng cường được sử dụng rộng rãi để hậu huấn luyện các mô hình ngôn ngữ lớn. Phương pháp này nhắm vào một điểm yếu đã biết của GRPO, hàm mục tiêu dựa trên nhóm đã trở thành chuẩn mực để dạy các mô hình suy luận: khi phần thưởng chỉ đơn giản là đúng hoặc sai, việc chuẩn hóa trong nhóm của GRPO cuối cùng lại dồn một tỷ lệ tín hiệu học không cân xứng vào những prompt mà mô hình vốn đã giải được, lãng phí công sức ở nơi còn rất ít để học. Vấn đề này tồi tệ nhất trong những bối cảnh không có bộ chấm điểm tự động rẻ tiền, chẳng hạn như tóm tắt hoặc viết sáng tạo, nơi việc huấn luyện phải dựa vào những điểm số trùng lặp văn bản yếu. SoftmaxGRPO là một bản thay thế trực tiếp chỉ một dòng, đổi các lợi thế nhóm theo z-score của GRPO thành các trọng số softmax được co giãn theo nhiệt độ (temperature), vốn luôn bị chặn bất kể một prompt dễ đến đâu. Các tác giả củng cố thay đổi này bằng lý thuyết, suy ra chính xác hàm mục tiêu mà nó tối ưu hóa cho phần thưởng nhị phân và cho thấy cách một thiết lập nhiệt độ (temperature) di chuyển mượt mà phương pháp giữa hành vi giống REINFORCE và hành vi giống hợp lý cực đại (maximum-likelihood), đồng thời cũng vạch ra nơi những bảo đảm như vậy ngừng có hiệu lực đối với các thang phần thưởng phức tạp hơn. Trong các thí nghiệm tinh chỉnh một mô hình Qwen2.5 1,5 tỷ tham số trong những điều kiện giống hệt nhau, SoftmaxGRPO đã dịch chuyển một cách đo lường được ngân sách gradient ra khỏi những prompt gần như đã giải xong (trên GSM8K nó dành 10 phần trăm ngân sách của mình cho những prompt vốn đã dễ so với 36 phần trăm của GRPO) và luôn đánh bại GRPO trên cùng phần thưởng. Nó đạt 51,8 phần trăm trên benchmark DeepMath với phần thưởng có thể xác minh và nâng điểm viết Poetry từ 35,0 lên 68,0 chỉ bằng phần thưởng tương đồng nhẹ, và nó dẫn đầu cả năm benchmark không thể xác minh trải rộng trên tóm tắt, tuân theo chỉ dẫn và kiến thức tổng quát.

trích dẫn

@inproceedings{hernandez2026softmaxgrpo,
  title = {SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation},
  author = {Hernandez, Jefferson and Koo, Jaywon and Xiao, Zilin and Wei, Chen and Ordonez, Vicente},
  year = {2026},
  booktitle = {Confererence on Language Modeling (COLM), 2026},
  url = {https://arxiv.org/abs/2608.09271},
}

câu hỏi, đóng góp chính và hạn chế của bài báo này được tạo tự động

Câu hỏi mà bài báo này giúp trả lời

  • SoftmaxGRPO là gì và nó giải quyết vấn đề gì? SoftmaxGRPO (Softmax Advantage Group Estimation) là một bản thay thế trực tiếp cho hàm mục tiêu học tăng cường GRPO, thay các lợi thế nhóm được chuẩn hóa theo z-score bằng các lợi thế softmax được co giãn theo nhiệt độ (temperature); nó giải quyết xu hướng của GRPO, dưới phần thưởng nhị phân, là tập trung tín hiệu gradient vào những prompt dễ, vốn đã giải xong, bằng cách giữ cho trọng số trên mỗi prompt bị chặn ở mọi mức độ khó.
  • SoftmaxGRPO thực sự thay đổi bước cập nhật như thế nào? Cho M rollout trên mỗi prompt với phần thưởng r_i, nó tạo ra các trọng số trong nhóm w_i tỷ lệ với exp(r_i / tau) và các lợi thế được căn giữa A_i = M * w_i - 1, trong đó nhiệt độ tau kiểm soát mức độ chênh lệch phần thưởng được chuyển thành trọng số sắc bén đến đâu; trên thực tế nó được tối ưu hóa bằng cách cắt (clipping) PPO thông thường và một hình phạt KL theo mô hình tham chiếu.
  • Bài báo cung cấp những bảo đảm lý thuyết nào? Đối với phần thưởng nhị phân trong chế độ on-policy không cắt (unclipped), nó suy ra một hàm mục tiêu nhóm hữu hạn chính xác với trọng số prompt bị chặn và xác định MaxRL là giới hạn nhiệt độ thấp của nó, và đối với phần thưởng vô hướng bị chặn, nó cho thấy bước cập nhật nhóm lớn tối ưu hóa chính xác một hàm mục tiêu hàm sinh log-moment, đồng thời chứng minh rằng không tồn tại một phép tương tự vô hướng nhóm hữu hạn phổ quát một khi có từ ba mức phần thưởng trở lên.
  • SoftmaxGRPO cải thiện so với GRPO bao nhiêu về mặt thực nghiệm? Dưới cùng phần thưởng tương đồng yếu giống hệt nhau, nó cải thiện so với GRPO thêm +7,0 điểm trên GSM8K, +3,3 trên Countdown và +1,2 trên DeepMath, đạt 51,8 phần trăm trên DeepMath với phần thưởng bộ xác minh chính xác, và nâng điểm Poetry của một mô hình 1,5B từ 35,0 lên 68,0, đồng thời dẫn đầu cả năm benchmark không thể xác minh được thử nghiệm.
  • SoftmaxGRPO có thay đổi nơi mô hình dồn công sức học tập hay không? Có; một phép đo phân bổ gradient cho thấy GRPO phân bổ 36,4 phần trăm ngân sách gradient GSM8K của nó cho những prompt gần như đã giải xong (tỷ lệ vượt qua ở mức bằng hoặc trên 0,9) so với 10,0 phần trăm đối với SoftmaxGRPO, xác nhận sự tái phân bổ được dự đoán hướng tới những ví dụ khó hơn còn nhiều dư địa để cải thiện.

Đóng góp chính

  • Giới thiệu SoftmaxGRPO, một bản thay thế trực tiếp chỉ một dòng cho GRPO, thay các lợi thế nhóm softmax được co giãn theo nhiệt độ (temperature) cho các lợi thế nhóm theo z-score, giữ cho trọng số theo độ khó của prompt bị chặn ở mọi tỷ lệ vượt qua.
  • Suy ra hàm mục tiêu phần thưởng nhị phân nhóm hữu hạn chính xác do phương pháp tạo ra, thiết lập MaxRL là giới hạn nhiệt độ thấp của nó, và chứng minh một hàm mục tiêu nhóm lớn chính xác cho phần thưởng vô hướng bị chặn.
  • Cho thấy một ranh giới lý thuyết rõ nét: với từ ba mức phần thưởng trở lên, không tồn tại hàm mục tiêu vô hướng nhóm hữu hạn phổ quát nào nếu không có thêm giả định về phân phối phần thưởng.
  • Chứng minh thông qua một thí nghiệm ImageNet có kiểm soát rằng, với đủ số rollout, SoftmaxGRPO bám sát chặt chẽ huấn luyện hợp lý cực đại (maximum-likelihood, cross-entropy) chính xác ở nơi REINFORCE không tiến triển được từ những tỷ lệ thành công ban đầu thấp.
  • Cung cấp các phép đo trực tiếp cho thấy SoftmaxGRPO tái phân bổ ngân sách gradient ra khỏi những prompt gần như đã giải xong và luôn vượt trội hơn GRPO dưới cùng phần thưởng trên cả các nhiệm vụ có thể xác minh lẫn không thể xác minh.

Hạn chế và lưu ý

  • Định lý nhóm hữu hạn chính xác được thiết lập cho phần thưởng nhị phân dưới tối ưu hóa on-policy không cắt (unclipped), nên việc mở rộng cùng những bảo đảm đó sang các cấu trúc phần thưởng phong phú hơn là một hướng tự nhiên cho công trình tương lai.
  • Kết quả phần thưởng vô hướng mang tính tiệm cận theo kích thước nhóm, và bài báo cẩn thận cho thấy rằng bước cập nhật nhóm hữu hạn nhìn chung là không bảo toàn một khi phần thưởng nhận từ ba mức trở lên, điều này làm rõ một cách hữu ích nơi có thể và không thể kỳ vọng một hàm mục tiêu gọn gàng.
  • Thuật toán thực tế sử dụng cắt (clipping) PPO và điều chuẩn KL theo mô hình tham chiếu, mà các tác giả coi là một phép xấp xỉ vùng tin cậy (trust-region) đối với hàm mục tiêu on-policy chính xác chứ không phải là một phần của định lý.
  • Các đánh giá chính tập trung vào một mô hình 1,5 tỷ tham số, nên việc kiểm chứng ở quy mô rộng hơn sẽ giúp xác nhận cách những cải thiện quan sát được chuyển sang các mô hình lớn hơn.
  • Các kết quả không thể xác minh dựa vào phần thưởng trùng lặp văn bản không hoàn hảo và đánh giá dùng LLM làm giám khảo (LLM-as-a-judge), và hiệu năng nhạy cảm với siêu tham số nhiệt độ (temperature), nên đánh giá hiện tại vẫn còn dư địa để thử nghiệm việc lựa chọn nhiệt độ thích ứng và các phần thưởng cấp quá trình phong phú hơn.

Cách diễn giải kết quả này

Bài báo này được đọc tốt nhất như một sự tinh lọc GRPO có cơ sở lý thuyết và được kiểm chứng thực nghiệm, khắc phục một khiếm khuyết cụ thể trong cách tín hiệu học được phân bổ theo độ khó của prompt, mang lại những cải thiện nhất quán trên cả các nhiệm vụ có thể xác minh lẫn được giám sát yếu chỉ bằng một thay đổi một dòng, đồng thời minh bạch một cách đáng khen rằng những bảo đảm sắc bén nhất của nó có hiệu lực cho phần thưởng nhị phân ở quy mô 1,5B được nghiên cứu.