Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
publication

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez
Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026.
Nachrichtenredaktion des Labors

Zusammenfassung der Pressemitteilung

Dieser Abschnitt ist bewusst im Stil einer Pressemitteilung in journalistischem Ton für ein allgemeines Publikum verfasst.

Modelle mit Retrieval suchen meist Beispiele, die dem Prompt ähneln, doch bei schwierigen Problemen kann eine gemeinsame Lösungsstrategie wichtiger sein. RA-RFT trainiert einen Retriever, Demonstrationen nach ihrem erwarteten Nutzen für das Schließen auszuwählen, und verwendet diese Analogien beim Reinforcement Fine-Tuning. Beim mathematischen Schließen übertrifft es Standardverfahren. Auf AIME 2025 beträgt der average@32-Gewinn gegenüber GRPO 7,1 Punkte für Qwen3-1.7B und 2,8 für Qwen3-4B.

Zusammenfassung

Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.

Zitation

@inproceedings{xiao2026learning,
  title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
  author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
  year = {2026},
  booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
  url = {https://arxiv.org/abs/2606.13680},
}

automatisch generierte Fragen, wichtigste Beiträge und Grenzen dieses Artikels

Fragen, die dieser Artikel beantworten hilft

  • Was ist RA-RFT? Ein Post-Training-Framework, das reasoning-orientiertes Retrieval und Reinforcement Fine-Tuning mit analogen Lösungen verbindet.
  • Wie unterscheidet es sich von klassischem RAG? Kontexte werden nach erwartetem Reasoning-Nutzen statt vor allem nach Textähnlichkeit geordnet.
  • Wie wird der Retriever trainiert? Durch Gold-Relevanz-Destillation, die nützliche Demonstrationen kennzeichnet.
  • Welche Ergebnisse werden berichtet? Auf AIME 2025 average@32 liegt RA-RFT 7,1 Punkte über GRPO mit Qwen3-1.7B und 2,8 mit Qwen3-4B.

Wichtigste Beiträge

  • RA-RFT ruft analoge Lösungsstrategien statt nur ähnlichen Text ab.
  • Es verbindet einen destillierten Retriever, Reinforcement Fine-Tuning, Demonstrationen und verifizierbare Belohnungen.
  • Die Analyse zeigt komplementäre Reasoning-Gerüste.
  • Die Ergebnisse verbessern Standard-RFT für zwei Qwen3-Größen.

Grenzen und Vorbehalte

  • Die Evaluation ist mathematisch; Code, Wissenschaft und offene Aufgaben sind wichtige nächste Tests.
  • Die Methode hängt von Gold-Relevanz-Destillation ab.
  • Retrieval-Kosten, Korpussensitivität und verrauschte Demonstrationen sollten im Einsatz gemessen werden.
  • Nicht jede Aufgabe profitiert gleich stark von Analogien, doch die Gewinne etablieren einen vielversprechenden ergänzenden Ansatz.

Wie dieses Ergebnis zu lesen ist

RA-RFT zeigt überzeugend, dass Retrieval das Schließen verbessert, wenn es nicht nur Information, sondern die passenden Analogien liefert.