Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
Resumo do comunicado de imprensa
Sistemas de perguntas e respostas em vídeo frequentemente produzem longas cadeias escritas de raciocínio mesmo quando basta localizar o momento correto. Dynamic Latent Reasoning (DyLaR) representa a evidência visual e, quando necessário, o raciocínio adicional em estados latentes compactos, em vez de texto extenso. O sistema aprende quando responder após a percepção e quando acrescentar raciocínio. Em nove benchmarks e quatro modelos-base, os autores relatam maior precisão média com menos de 20 tokens por pergunta; com Qwen3-VL-4B, DyLaR eleva a precisão de 54,0 para 58,2 e reduz a resposta média de 1.220,7 para 18,5 tokens.
resumo
Video question answering requires models to ground language queries in visual evidence and, when necessary, reason over that evidence across time. Existing methods typically rely on long textual chain-of-thought rationales, even though many questions can be answered as soon as the relevant object, action, or frame is localized. We propose Dynamic Latent Reasoning (DyLaR), which first grounds a question in a short block of perception latents (continuous hidden states that encode query-relevant visual evidence), and then adaptively decides whether to append reasoning latents (continuous thoughts that reason over this evidence in latent space) before answering. DyLaR learns this behavior by grounding perception latents in verified visual evidence and distilling verified rationales into reasoning latents, followed by reinforcement learning that further refines when to reason. Across nine video benchmarks and four multimodal language model backbones, DyLaR improves average accuracy over same-backbone baselines while generating fewer than 20 tokens per query. On Qwen3-VL-4B, for example, DyLaR improves average accuracy over Qwen3-VL-4B-Thinking from 54.0 to 58.2 while reducing response length from 1,220.7 to 18.5 tokens per query. Ablations further show that grounded perception latents, rationale-supervised reasoning latents, and adaptive routing each improve accuracy.
citação
@article{xiaperception,
title = {Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering},
author = {Xia, Haotian and Xiao, Zilin and Zou, Junbo and Ordonez, Vicente and Chen, Hanjie},
journal = {arXiv preprint arXiv:2608.04124},
url = {https://arxiv.org/abs/2608.04124},
}
perguntas, principais contribuições e limitações deste artigo geradas automaticamente
Perguntas que este artigo ajuda a responder
- Que problema o DyLaR aborda? Ele reduz longos rastros textuais ao ancorar primeiro a pergunta em estados latentes compactos de evidência visual e raciocinar apenas quando necessário.
- Como decide se deve raciocinar mais? Um roteamento adaptativo aprendido escolhe entre responder após a percepção ou adicionar latentes de raciocínio.
- Que supervisão é usada? Evidência visual verificada, raciocínios verificados destilados em latentes e aprendizado por reforço para refinar o roteamento.
- Quais resultados são relatados? Em nove benchmarks e quatro backbones, melhora a precisão com menos de 20 tokens; Qwen3-VL-4B passa de 54,0 para 58,2.
Principais contribuições
- DyLaR separa percepção relevante de raciocínio latente opcional para adaptar o cálculo a cada pergunta.
- O treinamento combina evidência visual, raciocínios verificados e reforço para roteamento adaptativo.
- As ablações mostram ganhos de latentes perceptivos, latentes de raciocínio e roteamento.
- A avaliação abrange nove benchmarks de vídeo e quatro backbones multimodais.
Limitações e ressalvas
- A avaliação se concentra em perguntas sobre vídeo; outras tarefas multimodais ainda precisam ser testadas.
- Evidências e raciocínios verificados podem exigir novas estratégias para escalar a outros domínios.
- Além do tamanho da saída, latência, memória e computação visual devem ser medidos.
- Os resultados são de benchmarks, mas a consistência entre backbones sustenta a promessa do método.
Como interpretar este resultado
DyLaR é uma abordagem bem fundamentada para tornar seletivo o raciocínio em perguntas sobre vídeo, com resultados sólidos e eficiência a validar em cenários mais amplos.