Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Sintesi del comunicato stampa
I modelli con recupero cercano spesso esempi simili al prompt, ma per un problema difficile può essere più utile un esempio con la stessa strategia risolutiva. RA-RFT addestra un retriever a scegliere dimostrazioni per il beneficio atteso sul ragionamento e usa tali analogie nel fine-tuning per rinforzo. Nel ragionamento matematico supera il fine-tuning standard. Su AIME 2025, il guadagno average@32 su GRPO è 7,1 punti per Qwen3-1.7B e 2,8 per Qwen3-4B.
abstract
Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.
citazione
@inproceedings{xiao2026learning,
title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
year = {2026},
booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
url = {https://arxiv.org/abs/2606.13680},
}
domande, principali contributi e limiti di questo articolo generati automaticamente
Domande a cui questo articolo aiuta a rispondere
- Che cos’è RA-RFT? Un framework di post-training che combina recupero orientato al ragionamento e fine-tuning per rinforzo con soluzioni analoghe.
- Come differisce dal RAG tradizionale? Ordina i contesti per beneficio atteso sul ragionamento anziché soprattutto per somiglianza testuale.
- Come si addestra il retriever? Con distillazione della rilevanza gold che identifica le dimostrazioni utili.
- Quali risultati ottiene? Su AIME 2025 average@32 supera GRPO di 7,1 punti con Qwen3-1.7B e 2,8 con Qwen3-4B.
Principali contributi
- RA-RFT recupera strategie risolutive analoghe, non solo testo simile.
- Combina retriever distillato, rinforzo, dimostrazioni recuperate e ricompense verificabili.
- L’analisi mostra strutture di ragionamento complementari.
- Migliora il fine-tuning per rinforzo standard su due dimensioni di Qwen3.
Limiti e avvertenze
- La valutazione è matematica; codice, scienza e attività aperte restano da studiare.
- Il metodo dipende dalla distillazione di rilevanza gold.
- Costo di recupero, sensibilità al corpus e dimostrazioni rumorose meritano misure di deployment.
- Non ogni attività beneficia allo stesso modo dall’analogia, ma i guadagni rendono promettente questo asse.
Come interpretare questo risultato
RA-RFT mostra con solide evidenze che il recupero può migliorare il ragionamento fornendo non solo informazioni, ma le analogie giuste.