Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
publication

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez
Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026.
Новостная редакция лаборатории

Краткое изложение пресс-релиза

Этот раздел намеренно написан в стиле журналистского пресс-релиза для широкой аудитории.

Модели с поиском обычно выбирают примеры, похожие на запрос, хотя трудной задаче может больше помочь аналогичная стратегия решения. RA-RFT обучает ретривер выбирать демонстрации по ожидаемой пользе для рассуждения и использует эти аналогии при обучении с подкреплением. В математическом рассуждении метод превосходит стандартное reinforcement fine-tuning. На AIME 2025 выигрыш average@32 над GRPO составляет 7,1 пункта для Qwen3-1.7B и 2,8 для Qwen3-4B.

аннотация

Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.

цитирование

@inproceedings{xiao2026learning,
  title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
  author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
  year = {2026},
  booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
  url = {https://arxiv.org/abs/2606.13680},
}

автоматически сгенерированные вопросы, основные вклады и ограничения этой статьи

Вопросы, на которые помогает ответить эта статья

  • Что такое RA-RFT? Посттренировочная схема, объединяющая поиск для рассуждения и reinforcement fine-tuning с аналогичными решениями.
  • Чем она отличается от обычного RAG? Контексты ранжируются по ожидаемой пользе для рассуждения, а не главным образом по сходству текста.
  • Как обучается ретривер? Дистилляцией эталонной релевантности, отмечающей полезные демонстрации.
  • Каковы результаты? На AIME 2025 average@32 метод опережает GRPO на 7,1 пункта для Qwen3-1.7B и 2,8 для Qwen3-4B.

Основные вклады

  • RA-RFT ищет аналогичные стратегии решения, а не только похожий текст.
  • Он объединяет дистиллированный ретривер, обучение с подкреплением, демонстрации и проверяемые награды.
  • Анализ выявляет взаимодополняющие структуры рассуждения.
  • Результаты улучшают стандартное RFT для двух размеров Qwen3.

Ограничения и предостережения

  • Оценка математическая; программирование, наука и открытые задачи — важные следующие направления.
  • Метод зависит от дистилляции эталонной релевантности.
  • Следует измерить стоимость поиска, чувствительность к корпусу и влияние шумных демонстраций.
  • Не все задачи одинаково выигрывают от аналогий, но результаты показывают перспективность этого направления.

Как интерпретировать этот результат

RA-RFT убедительно показывает, что поиск улучшает рассуждение, когда предоставляет не просто информацию, а подходящие аналогии.