Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
preprint

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen
arXiv:2608.04124
Mesa de noticias del laboratorio

Resumen de prensa

Esta sección está escrita intencionadamente con un tono de nota de prensa, en estilo periodístico, para el público general.

Los sistemas de preguntas y respuestas sobre video suelen producir largas cadenas de razonamiento escritas, incluso cuando basta con localizar el momento adecuado de un clip. Este trabajo presenta Dynamic Latent Reasoning (DyLaR), que representa la evidencia visual y, cuando hace falta, el razonamiento adicional mediante estados latentes internos compactos en lugar de texto extenso. El sistema aprende cuándo responder tras la percepción y cuándo añadir un paso de razonamiento. En nueve benchmarks y cuatro modelos base, los autores reportan mayor precisión media con menos de 20 tokens generados por pregunta; con Qwen3-VL-4B, DyLaR eleva la precisión media de 54,0 a 58,2 y reduce la longitud media de la respuesta de 1.220,7 a 18,5 tokens.

resumen

Video question answering requires models to ground language queries in visual evidence and, when necessary, reason over that evidence across time. Existing methods typically rely on long textual chain-of-thought rationales, even though many questions can be answered as soon as the relevant object, action, or frame is localized. We propose Dynamic Latent Reasoning (DyLaR), which first grounds a question in a short block of perception latents (continuous hidden states that encode query-relevant visual evidence), and then adaptively decides whether to append reasoning latents (continuous thoughts that reason over this evidence in latent space) before answering. DyLaR learns this behavior by grounding perception latents in verified visual evidence and distilling verified rationales into reasoning latents, followed by reinforcement learning that further refines when to reason. Across nine video benchmarks and four multimodal language model backbones, DyLaR improves average accuracy over same-backbone baselines while generating fewer than 20 tokens per query. On Qwen3-VL-4B, for example, DyLaR improves average accuracy over Qwen3-VL-4B-Thinking from 54.0 to 58.2 while reducing response length from 1,220.7 to 18.5 tokens per query. Ablations further show that grounded perception latents, rationale-supervised reasoning latents, and adaptive routing each improve accuracy.

cita

@article{xiaperception,
  title = {Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering},
  author = {Xia, Haotian and Xiao, Zilin and Zou, Junbo and Ordonez, Vicente and Chen, Hanjie},
  journal = {arXiv preprint arXiv:2608.04124},
  url = {https://arxiv.org/abs/2608.04124},
}

preguntas, contribuciones principales y limitaciones de este artículo generadas automáticamente

Preguntas que ayuda a responder este artículo

  • ¿Qué problema aborda DyLaR? Reduce la necesidad de largas cadenas textuales en preguntas y respuestas sobre video al fundamentar primero la pregunta en estados latentes compactos de evidencia visual y añadir razonamiento latente solo cuando es necesario.
  • ¿Cómo decide DyLaR si debe razonar más? Aprende un enrutamiento adaptativo que puede responder después de la percepción o agregar razonamiento latente antes de producir la respuesta.
  • ¿Qué supervisión se utiliza para entrenar las representaciones latentes? El método fundamenta los latentes de percepción en evidencia visual verificada, destila razonamientos verificados en latentes de razonamiento y después refina el comportamiento mediante aprendizaje por refuerzo.
  • ¿Qué resultados obtiene DyLaR? En nueve benchmarks de video y cuatro modelos base mejora la precisión media usando menos de 20 tokens de salida por consulta; con Qwen3-VL-4B pasa de 54,0 a 58,2 frente a su baseline de razonamiento.

Contribuciones principales

  • DyLaR separa la percepción visual relevante para la consulta del razonamiento latente opcional, de modo que cada pregunta puede usar una cantidad distinta de cómputo.
  • El entrenamiento combina supervisión perceptiva basada en evidencia, supervisión de razonamiento derivada de explicaciones y aprendizaje por refuerzo para el enrutamiento adaptativo.
  • Las ablaciones reportadas muestran beneficios de los latentes perceptivos fundamentados, los latentes de razonamiento supervisados y el enrutamiento adaptativo.
  • La evaluación abarca nueve benchmarks de video y cuatro modelos multimodales base.

Limitaciones y advertencias

  • La evaluación actual se concentra en preguntas y respuestas sobre video; aplicar el mismo enrutamiento a otras tareas multimodales es un siguiente paso útil.
  • El entrenamiento depende de evidencia visual y razonamientos verificados; trabajos futuros podrían estudiar cómo escalan estas señales de supervisión a nuevos dominios de video.
  • La eficiencia se mide sobre todo mediante la longitud de la salida; estudios de despliegue también podrían medir latencia, memoria y cómputo visual.
  • Los resultados proceden de benchmarks, aunque las mejoras consistentes entre varios modelos base ofrecen evidencia alentadora sobre la utilidad del enrutamiento latente.

Cómo interpretar este resultado

DyLaR debe interpretarse como un enfoque bien sustentado para que los sistemas de preguntas y respuestas sobre video elijan mejor cuándo razonar, con evidencia sólida en benchmarks y margen para comprobar sus ventajas de eficiencia en escenarios más amplios.