Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Tóm tắt thông cáo báo chí
Mô hình có truy hồi thường tìm ví dụ giống prompt, nhưng bài toán khó có thể cần ví dụ chia sẻ chiến lược giải. RA-RFT huấn luyện bộ truy hồi chọn minh họa theo lợi ích dự kiến cho suy luận rồi dùng các phép tương tự này trong tinh chỉnh tăng cường. Trên suy luận toán học, phương pháp vượt tinh chỉnh tăng cường tiêu chuẩn. Với AIME 2025, mức tăng average@32 so với GRPO là 7,1 điểm cho Qwen3-1.7B và 2,8 cho Qwen3-4B.
tóm tắt
Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.
trích dẫn
@inproceedings{xiao2026learning,
title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
year = {2026},
booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
url = {https://arxiv.org/abs/2606.13680},
}
câu hỏi, đóng góp chính và hạn chế của bài báo này được tạo tự động
Câu hỏi mà bài báo này giúp trả lời
- RA-RFT là gì? Khung hậu huấn luyện kết hợp truy hồi hướng suy luận và tinh chỉnh tăng cường với lời giải tương tự.
- Khác RAG thông thường thế nào? Ngữ cảnh được xếp theo lợi ích dự kiến cho suy luận thay vì chủ yếu theo độ giống văn bản.
- Bộ truy hồi được huấn luyện thế nào? Bằng chưng cất độ liên quan chuẩn để xác định minh họa hữu ích.
- Kết quả ra sao? Trên AIME 2025 average@32, vượt GRPO 7,1 điểm với Qwen3-1.7B và 2,8 với Qwen3-4B.
Đóng góp chính
- RA-RFT truy hồi chiến lược giải tương tự thay vì chỉ văn bản tương tự.
- Kết hợp bộ truy hồi chưng cất, tinh chỉnh tăng cường, minh họa truy hồi và phần thưởng kiểm chứng được.
- Phân tích cho thấy các cấu trúc suy luận bổ sung cho nhau.
- Kết quả cải thiện RFT tiêu chuẩn ở hai kích thước Qwen3.
Hạn chế và lưu ý
- Đánh giá tập trung vào toán; lập trình, khoa học và tác vụ mở là bước tiếp theo.
- Phương pháp phụ thuộc vào chưng cất độ liên quan chuẩn.
- Chi phí truy hồi, độ nhạy với kho dữ liệu và minh họa nhiễu cần được đo khi triển khai.
- Không phải mọi tác vụ đều hưởng lợi như nhau từ phép tương tự, nhưng kết quả cho thấy đây là hướng bổ sung hứa hẹn.
Cách diễn giải kết quả này
RA-RFT cho thấy thuyết phục rằng truy hồi có thể cải thiện suy luận khi cung cấp không chỉ thông tin mà còn đúng phép tương tự.