Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
Краткое изложение пресс-релиза
Системы ответов на вопросы по видео часто создают длинные текстовые цепочки рассуждений, хотя иногда достаточно найти нужный момент. Dynamic Latent Reasoning (DyLaR) представляет визуальные свидетельства и, при необходимости, дополнительное рассуждение компактными скрытыми состояниями вместо длинного текста. Система учится отвечать сразу после восприятия либо добавлять этап рассуждения. На девяти бенчмарках и четырёх базовых моделях авторы сообщают о более высокой средней точности при менее чем 20 токенах на вопрос; для Qwen3-VL-4B точность растёт с 54,0 до 58,2, а средняя длина ответа сокращается с 1 220,7 до 18,5 токена.
аннотация
Video question answering requires models to ground language queries in visual evidence and, when necessary, reason over that evidence across time. Existing methods typically rely on long textual chain-of-thought rationales, even though many questions can be answered as soon as the relevant object, action, or frame is localized. We propose Dynamic Latent Reasoning (DyLaR), which first grounds a question in a short block of perception latents (continuous hidden states that encode query-relevant visual evidence), and then adaptively decides whether to append reasoning latents (continuous thoughts that reason over this evidence in latent space) before answering. DyLaR learns this behavior by grounding perception latents in verified visual evidence and distilling verified rationales into reasoning latents, followed by reinforcement learning that further refines when to reason. Across nine video benchmarks and four multimodal language model backbones, DyLaR improves average accuracy over same-backbone baselines while generating fewer than 20 tokens per query. On Qwen3-VL-4B, for example, DyLaR improves average accuracy over Qwen3-VL-4B-Thinking from 54.0 to 58.2 while reducing response length from 1,220.7 to 18.5 tokens per query. Ablations further show that grounded perception latents, rationale-supervised reasoning latents, and adaptive routing each improve accuracy.
цитирование
@article{xiaperception,
title = {Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering},
author = {Xia, Haotian and Xiao, Zilin and Zou, Junbo and Ordonez, Vicente and Chen, Hanjie},
journal = {arXiv preprint arXiv:2608.04124},
url = {https://arxiv.org/abs/2608.04124},
}
автоматически сгенерированные вопросы, основные вклады и ограничения этой статьи
Вопросы, на которые помогает ответить эта статья
- Какую проблему решает DyLaR? Он сокращает длинные текстовые рассуждения, сначала связывая вопрос с компактными латентными представлениями визуальных свидетельств и добавляя рассуждение только при необходимости.
- Как система решает, рассуждать ли дальше? Обученная адаптивная маршрутизация выбирает между немедленным ответом и добавлением латентных шагов рассуждения.
- Какая супервизия используется? Проверенные визуальные свидетельства, дистилляция проверенных обоснований и обучение с подкреплением для маршрутизации.
- Каковы результаты? На девяти бенчмарках и четырёх моделях точность повышается при менее чем 20 токенах; Qwen3-VL-4B улучшается с 54,0 до 58,2.
Основные вклады
- DyLaR отделяет релевантное зрительное восприятие от необязательного латентного рассуждения и адаптирует вычисления к вопросу.
- Обучение сочетает визуальные свидетельства, проверенные обоснования и обучение с подкреплением.
- Абляции подтверждают вклад перцептивных латентов, латентов рассуждения и адаптивной маршрутизации.
- Оценка охватывает девять видеобенчмарков и четыре мультимодальные базовые модели.
Ограничения и предостережения
- Оценка сосредоточена на вопросах по видео; другие мультимодальные задачи ещё предстоит проверить.
- Масштабирование проверенных свидетельств и обоснований на новые домены требует дальнейшего изучения.
- Помимо длины ответа полезно измерять задержку, память и вычисления для видео.
- Результаты получены на бенчмарках, но устойчивость улучшений между моделями обнадёживает.
Как интерпретировать этот результат
DyLaR следует рассматривать как хорошо обоснованный способ избирательно применять рассуждение в видео-QA, с сильными результатами и перспективой более широкой проверки эффективности.