Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
Tóm tắt thông cáo báo chí
Các hệ thống hỏi đáp video thường tạo chuỗi suy luận bằng văn bản rất dài dù đôi khi chỉ cần tìm đúng khoảnh khắc. Dynamic Latent Reasoning (DyLaR) biểu diễn bằng chứng thị giác và phần suy luận bổ sung, khi cần, dưới dạng trạng thái ẩn gọn thay vì văn bản dài. Hệ thống học khi nào nên trả lời sau bước nhận thức và khi nào cần suy luận thêm. Trên chín benchmark và bốn mô hình nền, tác giả báo cáo độ chính xác trung bình cao hơn với dưới 20 token mỗi câu hỏi; với Qwen3-VL-4B, độ chính xác tăng từ 54,0 lên 58,2 và độ dài câu trả lời giảm từ 1.220,7 xuống 18,5 token.
tóm tắt
Video question answering requires models to ground language queries in visual evidence and, when necessary, reason over that evidence across time. Existing methods typically rely on long textual chain-of-thought rationales, even though many questions can be answered as soon as the relevant object, action, or frame is localized. We propose Dynamic Latent Reasoning (DyLaR), which first grounds a question in a short block of perception latents (continuous hidden states that encode query-relevant visual evidence), and then adaptively decides whether to append reasoning latents (continuous thoughts that reason over this evidence in latent space) before answering. DyLaR learns this behavior by grounding perception latents in verified visual evidence and distilling verified rationales into reasoning latents, followed by reinforcement learning that further refines when to reason. Across nine video benchmarks and four multimodal language model backbones, DyLaR improves average accuracy over same-backbone baselines while generating fewer than 20 tokens per query. On Qwen3-VL-4B, for example, DyLaR improves average accuracy over Qwen3-VL-4B-Thinking from 54.0 to 58.2 while reducing response length from 1,220.7 to 18.5 tokens per query. Ablations further show that grounded perception latents, rationale-supervised reasoning latents, and adaptive routing each improve accuracy.
trích dẫn
@article{xiaperception,
title = {Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering},
author = {Xia, Haotian and Xiao, Zilin and Zou, Junbo and Ordonez, Vicente and Chen, Hanjie},
journal = {arXiv preprint arXiv:2608.04124},
url = {https://arxiv.org/abs/2608.04124},
}
câu hỏi, đóng góp chính và hạn chế của bài báo này được tạo tự động
Câu hỏi mà bài báo này giúp trả lời
- DyLaR giải quyết vấn đề gì? Phương pháp giảm chuỗi suy luận dài bằng cách neo câu hỏi vào trạng thái ẩn của bằng chứng thị giác rồi chỉ thêm suy luận khi cần.
- Hệ thống quyết định suy luận thêm thế nào? Cơ chế định tuyến thích ứng đã học chọn trả lời sau nhận thức hoặc thêm trạng thái suy luận.
- Dùng tín hiệu giám sát nào? Bằng chứng thị giác đã xác minh, lời giải đã xác minh được chưng cất, và học tăng cường để tinh chỉnh định tuyến.
- Kết quả ra sao? Trên chín benchmark và bốn backbone, độ chính xác tăng với dưới 20 token; Qwen3-VL-4B tăng từ 54,0 lên 58,2.
Đóng góp chính
- DyLaR tách nhận thức thị giác liên quan khỏi suy luận ẩn tùy chọn để điều chỉnh lượng tính toán.
- Quy trình huấn luyện kết hợp bằng chứng, lời giải đã xác minh và học tăng cường.
- Thí nghiệm loại bỏ cho thấy vai trò của trạng thái nhận thức, suy luận và định tuyến thích ứng.
- Đánh giá bao phủ chín benchmark video và bốn backbone đa phương thức.
Hạn chế và lưu ý
- Đánh giá tập trung vào hỏi đáp video; các tác vụ đa phương thức khác cần được thử nghiệm.
- Việc mở rộng bằng chứng và lời giải đã xác minh sang miền mới cần nghiên cứu thêm.
- Ngoài độ dài đầu ra, nên đo độ trễ, bộ nhớ và chi phí tính toán thị giác.
- Kết quả dựa trên benchmark nhưng tính nhất quán giữa các backbone là tín hiệu tích cực.
Cách diễn giải kết quả này
DyLaR nên được xem là cách tiếp cận có bằng chứng tốt để suy luận có chọn lọc trong hỏi đáp video, với kết quả mạnh và hiệu quả cần được kiểm chứng rộng hơn.