Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
publication

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez
Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026.
Rubrique actualités du laboratoire

Résumé du communiqué de presse

Cette section est volontairement rédigée dans le style d'un communiqué de presse, sur un ton journalistique, à destination du grand public.

Les modèles augmentés par récupération cherchent généralement des exemples semblables au prompt, alors que le meilleur exemple pour un problème difficile peut surtout partager sa stratégie de résolution. RA-RFT entraîne un récupérateur à choisir les démonstrations selon leur bénéfice attendu pour le raisonnement, puis emploie ces analogies pendant l’ajustement par renforcement. Sur le raisonnement mathématique, cette récupération apporte des stratégies complémentaires et dépasse l’ajustement par renforcement standard. Sur AIME 2025, le gain average@32 sur GRPO atteint 7,1 points pour Qwen3-1.7B et 2,8 pour Qwen3-4B.

résumé

Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.

citation

@inproceedings{xiao2026learning,
  title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
  author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
  year = {2026},
  booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
  url = {https://arxiv.org/abs/2606.13680},
}

questions, principales contributions et limites de cet article générées automatiquement

Questions auxquelles cet article aide à répondre

  • Qu’est-ce que RA-RFT ? Un cadre de post-entraînement qui associe récupération orientée raisonnement et ajustement par renforcement pour apprendre de solutions analogues.
  • En quoi diffère-t-il du RAG classique ? Les contextes sont classés par bénéfice attendu pour le raisonnement plutôt que principalement par similarité lexicale ou sémantique.
  • Comment le récupérateur est-il entraîné ? Par distillation d’une pertinence de référence indiquant quelles démonstrations aident à résoudre le problème.
  • Quels résultats sont rapportés ? Sur AIME 2025 average@32, RA-RFT dépasse GRPO de 7,1 points avec Qwen3-1.7B et de 2,8 avec Qwen3-4B.

Principales contributions

  • RA-RFT recherche des stratégies de solution analogues plutôt que du texte seulement similaire.
  • Il combine récupérateur distillé, ajustement par renforcement, démonstrations récupérées et récompenses vérifiables.
  • L’analyse montre que la récupération raisonnée fournit des échafaudages complémentaires.
  • Les résultats améliorent l’ajustement par renforcement standard pour deux tailles de Qwen3.

Limites et mises en garde

  • L’évaluation cible les mathématiques ; code, sciences et tâches ouvertes restent à étudier.
  • La méthode dépend d’une distillation de pertinence supervisée.
  • Coût de récupération, sensibilité au corpus et démonstrations bruitées méritent une évaluation de déploiement.
  • Toutes les tâches ne profiteront pas nécessairement autant de l’analogie, mais les gains établissent la sélection d’exemples comme axe complémentaire.

Comment interpréter ce résultat

RA-RFT montre solidement que la récupération peut améliorer le raisonnement en apportant non seulement des informations, mais surtout les bonnes analogies.