Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Resumen de prensa
Los modelos de lenguaje con recuperación suelen buscar ejemplos parecidos al prompt actual, pero el ejemplo más útil para un problema difícil puede compartir su estrategia de solución sin parecerse superficialmente. RA-RFT entrena un recuperador para seleccionar demostraciones por su beneficio esperado para el razonamiento y usa esas analogías durante el ajuste fino por refuerzo. Los autores observan que la recuperación orientada al razonamiento aporta estrategias complementarias y supera al ajuste por refuerzo convencional en razonamiento matemático. En AIME 2025, la mejora reportada de average@32 frente a GRPO es de 7,1 puntos para Qwen3-1.7B y de 2,8 para Qwen3-4B.
resumen
Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.
cita
@inproceedings{xiao2026learning,
title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
year = {2026},
booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
url = {https://arxiv.org/abs/2606.13680},
}
preguntas, contribuciones principales y limitaciones de este artículo generadas automáticamente
Preguntas que ayuda a responder este artículo
- ¿Qué es RA-RFT? Es un marco de postentrenamiento que combina recuperación orientada al razonamiento con ajuste fino por refuerzo para aprender de soluciones análogas.
- ¿Cómo difiere su recuperación del RAG convencional? En vez de ordenar ejemplos principalmente por similitud léxica o semántica, aprende a ordenarlos por el beneficio esperado para el razonamiento objetivo.
- ¿Cómo se entrena el recuperador? Mediante destilación de relevancia con etiquetas de referencia que indican qué demostraciones ayudan a resolver un problema.
- ¿Qué resultados se reportan? En benchmarks matemáticos supera al ajuste fino por refuerzo estándar; en AIME 2025 average@32 aventaja a GRPO en 7,1 puntos con Qwen3-1.7B y 2,8 con Qwen3-4B.
Contribuciones principales
- RA-RFT plantea la recuperación para razonamiento como búsqueda de estrategias de solución análogas, no solo de texto semánticamente similar.
- Combina un recuperador destilado con ajuste fino por refuerzo, demostraciones recuperadas y recompensas de resultado verificables.
- El análisis muestra que la recuperación orientada al razonamiento ofrece estructuras complementarias para resolver problemas.
- Los resultados reportan mejoras sobre el ajuste fino por refuerzo estándar con Qwen3-1.7B y Qwen3-4B.
Limitaciones y advertencias
- La evaluación se concentra en razonamiento matemático; probar la recuperación análoga en programación, ciencia y tareas abiertas es un siguiente paso importante.
- El método depende de destilación con relevancia de referencia; trabajos futuros podrían estudiar cómo la calidad de esa supervisión afecta la transferencia.
- El estudio prioriza la exactitud; evaluaciones de despliegue también podrían cuantificar costo de recuperación, sensibilidad al corpus y ruido en las demostraciones.
- Las mejoras no implican que toda tarea se beneficie por igual de la analogía, pero muestran que la selección de ejemplos es un eje complementario útil.
Cómo interpretar este resultado
RA-RFT debe interpretarse como una demostración sólida de que la recuperación puede mejorar el razonamiento no solo aportando información, sino proporcionando las analogías adecuadas.