Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Краткое изложение пресс-релиза
Модели с поиском обычно выбирают примеры, похожие на запрос, хотя трудной задаче может больше помочь аналогичная стратегия решения. RA-RFT обучает ретривер выбирать демонстрации по ожидаемой пользе для рассуждения и использует эти аналогии при обучении с подкреплением. В математическом рассуждении метод превосходит стандартное reinforcement fine-tuning. На AIME 2025 выигрыш average@32 над GRPO составляет 7,1 пункта для Qwen3-1.7B и 2,8 для Qwen3-4B.
аннотация
Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.
цитирование
@inproceedings{xiao2026learning,
title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
year = {2026},
booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
url = {https://arxiv.org/abs/2606.13680},
}
автоматически сгенерированные вопросы, основные вклады и ограничения этой статьи
Вопросы, на которые помогает ответить эта статья
- Что такое RA-RFT? Посттренировочная схема, объединяющая поиск для рассуждения и reinforcement fine-tuning с аналогичными решениями.
- Чем она отличается от обычного RAG? Контексты ранжируются по ожидаемой пользе для рассуждения, а не главным образом по сходству текста.
- Как обучается ретривер? Дистилляцией эталонной релевантности, отмечающей полезные демонстрации.
- Каковы результаты? На AIME 2025 average@32 метод опережает GRPO на 7,1 пункта для Qwen3-1.7B и 2,8 для Qwen3-4B.
Основные вклады
- RA-RFT ищет аналогичные стратегии решения, а не только похожий текст.
- Он объединяет дистиллированный ретривер, обучение с подкреплением, демонстрации и проверяемые награды.
- Анализ выявляет взаимодополняющие структуры рассуждения.
- Результаты улучшают стандартное RFT для двух размеров Qwen3.
Ограничения и предостережения
- Оценка математическая; программирование, наука и открытые задачи — важные следующие направления.
- Метод зависит от дистилляции эталонной релевантности.
- Следует измерить стоимость поиска, чувствительность к корпусу и влияние шумных демонстраций.
- Не все задачи одинаково выигрывают от аналогий, но результаты показывают перспективность этого направления.
Как интерпретировать этот результат
RA-RFT убедительно показывает, что поиск улучшает рассуждение, когда предоставляет не просто информацию, а подходящие аналогии.