Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
publication

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez
Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026.
Mesa de notícias do laboratório

Resumo do comunicado de imprensa

Esta seção foi escrita intencionalmente em tom de comunicado de imprensa, em estilo jornalístico, para o público geral.

Modelos com recuperação costumam buscar exemplos parecidos com o prompt, mas um problema difícil pode se beneficiar mais de uma estratégia de solução análoga. RA-RFT treina um recuperador para escolher demonstrações pelo benefício esperado ao raciocínio e usa essas analogias no ajuste por reforço. Em raciocínio matemático, supera o ajuste por reforço padrão. No AIME 2025, o ganho average@32 sobre GRPO é de 7,1 pontos para Qwen3-1.7B e 2,8 para Qwen3-4B.

resumo

Retrieval-augmented generation (RAG) has become a standard mechanism for grounding language models in external knowledge, yet conventional retrieval based on lexical or semantic similarity is poorly suited for complex reasoning tasks: a semantically similar problem may demand an entirely different solution strategy, while a superficially different problem may share the same underlying reasoning pattern. We propose Retrieval-Augmented Reinforcement Fine-Tuning (RA-RFT), a post-training framework that teaches language models to reason by analogy. RA-RFT uses gold-relevance distillation to train a retriever that ranks contexts by expected reasoning benefit rather than semantic overlap, and then fine-tunes the policy model via reinforcement fine-tuning methods with retrieved analogous demonstrations, so the model learns to leverage reasoning traces under verifiable outcome rewards. We further analyze the diversity of retrieved contexts and find that reasoning-aware retrieval surfaces complementary solution strategies that provide distinct reasoning scaffolds for individual problems. Across challenging mathematical reasoning benchmarks, RA-RFT consistently outperforms standard reinforcement fine-tuning methods. For example, it improves AIME 2025 average@32 accuracy by 7.1 and 2.8 points over GRPO for Qwen3-1.7B and Qwen3-4B respectively -- suggesting that reasoning-aware retrieval is a complementary axis of improvement and orthogonal to advances in reward design or training curricula.

citação

@inproceedings{xiao2026learning,
  title = {Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning},
  author = {Xiao, Zilin and Ma, Qi and Chen, Chun-cheng Jason and Chen, Xintao and Atreya, Avinash and Chen, Hanjie and Ordonez, Vicente},
  year = {2026},
  booktitle = {Findings of the Conference on Empirical Methods in Natural Language Processing. EMNLP 2026},
  url = {https://arxiv.org/abs/2606.13680},
}

perguntas, principais contribuições e limitações deste artigo geradas automaticamente

Perguntas que este artigo ajuda a responder

  • O que é RA-RFT? Um framework de pós-treinamento que combina recuperação orientada ao raciocínio e ajuste por reforço com soluções análogas.
  • Como difere do RAG convencional? Classifica contextos pelo benefício esperado ao raciocínio, não principalmente pela semelhança textual.
  • Como o recuperador é treinado? Por destilação de relevância gold que identifica demonstrações úteis.
  • Quais resultados apresenta? No AIME 2025 average@32 supera GRPO em 7,1 pontos com Qwen3-1.7B e 2,8 com Qwen3-4B.

Principais contribuições

  • RA-RFT recupera estratégias de solução análogas, não apenas texto semelhante.
  • Combina recuperador destilado, reforço, demonstrações recuperadas e recompensas verificáveis.
  • A análise encontra estruturas complementares de raciocínio.
  • Os resultados melhoram o ajuste por reforço padrão em dois tamanhos do Qwen3.

Limitações e ressalvas

  • A avaliação é matemática; programação, ciência e tarefas abertas são próximos testes importantes.
  • O método depende de destilação de relevância gold.
  • Custo de recuperação, sensibilidade ao corpus e demonstrações ruidosas merecem avaliação em implantação.
  • Nem toda tarefa se beneficiará igualmente de analogias, mas os ganhos tornam esse eixo promissor.

Como interpretar este resultado

RA-RFT mostra de forma convincente que a recuperação pode melhorar o raciocínio fornecendo não só informação, mas as analogias certas.