Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
Resumo do comunicado de imprensa
Modelos com recuperação costumam buscar exemplos parecidos com o prompt, mas um problema difícil pode se beneficiar mais de uma estratégia de solução análoga. RA-RFT treina um recuperador para escolher demonstrações pelo benefício esperado ao raciocínio e usa essas analogias no ajuste por reforço. Em raciocínio matemático, supera o ajuste por reforço padrão. No AIME 2025, o ganho average@32 sobre GRPO é de 7,1 pontos para Qwen3-1.7B e 2,8 para Qwen3-4B.
resumo
Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.
citação
@inproceedings{xiao2026learning,
title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
year = {2026},
booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
url = {https://arxiv.org/abs/2606.13680},
}
perguntas, principais contribuições e limitações deste artigo geradas automaticamente
Perguntas que este artigo ajuda a responder
- O que é RA-RFT? Um framework de pós-treinamento que combina recuperação orientada ao raciocínio e ajuste por reforço com soluções análogas.
- Como difere do RAG convencional? Classifica contextos pelo benefício esperado ao raciocínio, não principalmente pela semelhança textual.
- Como o recuperador é treinado? Por destilação de relevância gold que identifica demonstrações úteis.
- Quais resultados apresenta? No AIME 2025 average@32 supera GRPO em 7,1 pontos com Qwen3-1.7B e 2,8 com Qwen3-4B.
Principais contribuições
- RA-RFT recupera estratégias de solução análogas, não apenas texto semelhante.
- Combina recuperador destilado, reforço, demonstrações recuperadas e recompensas verificáveis.
- A análise encontra estruturas complementares de raciocínio.
- Os resultados melhoram o ajuste por reforço padrão em dois tamanhos do Qwen3.
Limitações e ressalvas
- A avaliação é matemática; programação, ciência e tarefas abertas são próximos testes importantes.
- O método depende de destilação de relevância gold.
- Custo de recuperação, sensibilidade ao corpus e demonstrações ruidosas merecem avaliação em implantação.
- Nem toda tarefa se beneficiará igualmente de analogias, mas os ganhos tornam esse eixo promissor.
Como interpretar este resultado
RA-RFT mostra de forma convincente que a recuperação pode melhorar o raciocínio fornecendo não só informação, mas as analogias certas.