Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
Zusammenfassung der Pressemitteilung
Systeme zur Beantwortung von Videofragen erzeugen oft lange schriftliche Gedankengänge, obwohl manchmal das Auffinden des richtigen Moments genügt. Dynamic Latent Reasoning (DyLaR) stellt visuelle Evidenz und bei Bedarf zusätzliches Schließen als kompakte latente Zustände statt als langen Text dar. Das System lernt, wann es nach der Wahrnehmung antworten und wann es weiterdenken soll. Auf neun Benchmarks und vier Basismodellen berichten die Autoren höhere durchschnittliche Genauigkeit mit weniger als 20 Tokens pro Frage; bei Qwen3-VL-4B steigt sie von 54,0 auf 58,2, während die Antwortlänge von 1.220,7 auf 18,5 Tokens sinkt.
Zusammenfassung
Video question answering requires models to ground language queries in visual evidence and, when necessary, reason over that evidence across time. Existing methods typically rely on long textual chain-of-thought rationales, even though many questions can be answered as soon as the relevant object, action, or frame is localized. We propose Dynamic Latent Reasoning (DyLaR), which first grounds a question in a short block of perception latents (continuous hidden states that encode query-relevant visual evidence), and then adaptively decides whether to append reasoning latents (continuous thoughts that reason over this evidence in latent space) before answering. DyLaR learns this behavior by grounding perception latents in verified visual evidence and distilling verified rationales into reasoning latents, followed by reinforcement learning that further refines when to reason. Across nine video benchmarks and four multimodal language model backbones, DyLaR improves average accuracy over same-backbone baselines while generating fewer than 20 tokens per query. On Qwen3-VL-4B, for example, DyLaR improves average accuracy over Qwen3-VL-4B-Thinking from 54.0 to 58.2 while reducing response length from 1,220.7 to 18.5 tokens per query. Ablations further show that grounded perception latents, rationale-supervised reasoning latents, and adaptive routing each improve accuracy.
Zitation
@article{xiaperception,
title = {Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering},
author = {Xia, Haotian and Xiao, Zilin and Zou, Junbo and Ordonez, Vicente and Chen, Hanjie},
journal = {arXiv preprint arXiv:2608.04124},
url = {https://arxiv.org/abs/2608.04124},
}
automatisch generierte Fragen, wichtigste Beiträge und Grenzen dieses Artikels
Fragen, die dieser Artikel beantworten hilft
- Welches Problem adressiert DyLaR? Es reduziert lange textuelle Gedankengänge, indem Fragen zuerst in kompakter visueller Evidenz verankert und latentes Schließen nur bei Bedarf ergänzt werden.
- Wie entscheidet DyLaR über weiteres Schließen? Ein gelerntes adaptives Routing antwortet nach der Wahrnehmung oder fügt latente Denkschritte hinzu.
- Welche Supervision wird genutzt? Verifizierte visuelle Evidenz, aus verifizierten Begründungen destillierte Denklatente und Reinforcement Learning für das Routing.
- Welche Ergebnisse werden berichtet? Auf neun Benchmarks und vier Backbones steigt die Genauigkeit bei weniger als 20 Tokens; Qwen3-VL-4B verbessert sich von 54,0 auf 58,2.
Wichtigste Beiträge
- DyLaR trennt relevante visuelle Wahrnehmung von optionalem latentem Schließen und passt den Rechenaufwand an die Frage an.
- Das Training verbindet Evidenz, verifizierte Begründungen und Reinforcement Learning.
- Ablationen zeigen Beiträge der Wahrnehmungslatente, Denklatente und des adaptiven Routings.
- Die Evaluation umfasst neun Video-Benchmarks und vier multimodale Backbones.
Grenzen und Vorbehalte
- Die Evaluation konzentriert sich auf Video-QA; weitere multimodale Aufgaben bleiben zu prüfen.
- Verifizierte Evidenz und Begründungen könnten in neuen Domänen schwerer skalierbar sein.
- Neben der Ausgabelänge sollten Latenz, Speicher und visuelle Rechenkosten gemessen werden.
- Die Ergebnisse stammen aus Benchmarks, doch ihre Konsistenz über Backbones hinweg ist ermutigend.
Wie dieses Ergebnis zu lesen ist
DyLaR ist ein gut belegter Ansatz für selektiveres Schließen bei Videofragen, mit starken Benchmarkergebnissen und Effizienzvorteilen, die breiter validiert werden können.