Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
publication

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez
Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026.
Redazione notizie del laboratorio

Sintesi del comunicato stampa

Questa sezione è scritta volutamente con il tono di un comunicato stampa giornalistico, destinato al pubblico generale.

I modelli con recupero cercano spesso esempi simili al prompt, ma per un problema difficile può essere più utile un esempio con la stessa strategia risolutiva. RA-RFT addestra un retriever a scegliere dimostrazioni per il beneficio atteso sul ragionamento e usa tali analogie nel fine-tuning per rinforzo. Nel ragionamento matematico supera il fine-tuning standard. Su AIME 2025, il guadagno average@32 su GRPO è 7,1 punti per Qwen3-1.7B e 2,8 per Qwen3-4B.

abstract

Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.

citazione

@inproceedings{xiao2026learning,
  title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
  author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
  year = {2026},
  booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
  url = {https://arxiv.org/abs/2606.13680},
}

domande, principali contributi e limiti di questo articolo generati automaticamente

Domande a cui questo articolo aiuta a rispondere

  • Che cos’è RA-RFT? Un framework di post-training che combina recupero orientato al ragionamento e fine-tuning per rinforzo con soluzioni analoghe.
  • Come differisce dal RAG tradizionale? Ordina i contesti per beneficio atteso sul ragionamento anziché soprattutto per somiglianza testuale.
  • Come si addestra il retriever? Con distillazione della rilevanza gold che identifica le dimostrazioni utili.
  • Quali risultati ottiene? Su AIME 2025 average@32 supera GRPO di 7,1 punti con Qwen3-1.7B e 2,8 con Qwen3-4B.

Principali contributi

  • RA-RFT recupera strategie risolutive analoghe, non solo testo simile.
  • Combina retriever distillato, rinforzo, dimostrazioni recuperate e ricompense verificabili.
  • L’analisi mostra strutture di ragionamento complementari.
  • Migliora il fine-tuning per rinforzo standard su due dimensioni di Qwen3.

Limiti e avvertenze

  • La valutazione è matematica; codice, scienza e attività aperte restano da studiare.
  • Il metodo dipende dalla distillazione di rilevanza gold.
  • Costo di recupero, sensibilità al corpus e dimostrazioni rumorose meritano misure di deployment.
  • Non ogni attività beneficia allo stesso modo dall’analogia, ma i guadagni rendono promettente questo asse.

Come interpretare questo risultato

RA-RFT mostra con solide evidenze che il recupero può migliorare il ragionamento fornendo non solo informazioni, ma le analogie giuste.