Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Zusammenfassung der Pressemitteilung
Modelle mit Retrieval suchen meist Beispiele, die dem Prompt ähneln, doch bei schwierigen Problemen kann eine gemeinsame Lösungsstrategie wichtiger sein. RA-RFT trainiert einen Retriever, Demonstrationen nach ihrem erwarteten Nutzen für das Schließen auszuwählen, und verwendet diese Analogien beim Reinforcement Fine-Tuning. Beim mathematischen Schließen übertrifft es Standardverfahren. Auf AIME 2025 beträgt der average@32-Gewinn gegenüber GRPO 7,1 Punkte für Qwen3-1.7B und 2,8 für Qwen3-4B.
Zusammenfassung
Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.
Zitation
@inproceedings{xiao2026learning,
title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
year = {2026},
booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
url = {https://arxiv.org/abs/2606.13680},
}
automatisch generierte Fragen, wichtigste Beiträge und Grenzen dieses Artikels
Fragen, die dieser Artikel beantworten hilft
- Was ist RA-RFT? Ein Post-Training-Framework, das reasoning-orientiertes Retrieval und Reinforcement Fine-Tuning mit analogen Lösungen verbindet.
- Wie unterscheidet es sich von klassischem RAG? Kontexte werden nach erwartetem Reasoning-Nutzen statt vor allem nach Textähnlichkeit geordnet.
- Wie wird der Retriever trainiert? Durch Gold-Relevanz-Destillation, die nützliche Demonstrationen kennzeichnet.
- Welche Ergebnisse werden berichtet? Auf AIME 2025 average@32 liegt RA-RFT 7,1 Punkte über GRPO mit Qwen3-1.7B und 2,8 mit Qwen3-4B.
Wichtigste Beiträge
- RA-RFT ruft analoge Lösungsstrategien statt nur ähnlichen Text ab.
- Es verbindet einen destillierten Retriever, Reinforcement Fine-Tuning, Demonstrationen und verifizierbare Belohnungen.
- Die Analyse zeigt komplementäre Reasoning-Gerüste.
- Die Ergebnisse verbessern Standard-RFT für zwei Qwen3-Größen.
Grenzen und Vorbehalte
- Die Evaluation ist mathematisch; Code, Wissenschaft und offene Aufgaben sind wichtige nächste Tests.
- Die Methode hängt von Gold-Relevanz-Destillation ab.
- Retrieval-Kosten, Korpussensitivität und verrauschte Demonstrationen sollten im Einsatz gemessen werden.
- Nicht jede Aufgabe profitiert gleich stark von Analogien, doch die Gewinne etablieren einen vielversprechenden ergänzenden Ansatz.
Wie dieses Ergebnis zu lesen ist
RA-RFT zeigt überzeugend, dass Retrieval das Schließen verbessert, wenn es nicht nur Information, sondern die passenden Analogien liefert.