EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
Tóm tắt thông cáo báo chí
Một câu chuyện video dài đòi hỏi nhân vật, vật thể và địa điểm vẫn dễ nhận ra khi xuất hiện lại. EntityBench đo thách thức này trên 140 tập và 2.491 cảnh quay với lịch xuất hiện thực thể rõ ràng. Đánh giá tách chất lượng từng cảnh, mức bám sát prompt và tính nhất quán xuyên cảnh, đồng thời không tính các lần xuất hiện sai. EntityMem lưu tham chiếu hình ảnh đã xác minh của từng thực thể trong bộ nhớ bền vững. Thử nghiệm cho thấy tính nhất quán của các phương pháp hiện có giảm khi khoảng cách tái xuất hiện tăng, trong khi EntityMem đạt độ trung thực nhân vật cao nhất trong các phương pháp so sánh.
tóm tắt
Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.
trích dẫn
@article{heentitybench,
title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
journal = {arXiv preprint arXiv:2605.15199},
url = {https://arxiv.org/abs/2605.15199},
}
câu hỏi, đóng góp chính và hạn chế của bài báo này được tạo tự động
Câu hỏi mà bài báo này giúp trả lời
- EntityBench đo gì? Tính nhất quán của nhân vật, vật thể và địa điểm trong chuỗi video nhiều cảnh dài.
- Quy mô ra sao? 140 tập và 2.491 cảnh, tối đa 50 cảnh và khoảng tái xuất hiện 48 cảnh.
- Đánh giá tính nhất quán thế nào? Chất lượng, mức bám prompt và nhất quán được đo riêng; chỉ lần xuất hiện đúng mới được tính.
- EntityMem là gì? Baseline lưu tham chiếu đã xác minh cho từng thực thể trước khi sinh và dùng xuyên suốt chuỗi.
Đóng góp chính
- EntityBench cung cấp lịch theo cảnh cho nhân vật, vật thể và địa điểm từ nội dung kể chuyện thực.
- Benchmark có ba mức, tối đa 13 nhân vật, 8 địa điểm và 22 vật thể tái xuất hiện.
- Bộ đánh giá tách chất lượng hình ảnh, bám prompt và nhất quán dài hạn.
- EntityMem là baseline dùng bộ nhớ với lợi thế rõ về độ trung thực nhân vật.
Hạn chế và lưu ý
- Nguồn kể chuyện có thể chưa bao phủ mọi yêu cầu của video tương tác hoặc tài liệu.
- EntityMem giả định có tham chiếu đã xác minh trước khi sinh.
- Chuyển động, điện ảnh và tính liên tục nhân quả là các hướng bổ sung.
- Suy giảm ở khoảng cách dài cho thấy bài toán còn mở và khẳng định giá trị chẩn đoán của benchmark.
Cách diễn giải kết quả này
EntityBench là bộ thử được cấu trúc cẩn thận cho một điểm yếu cốt lõi của sinh video dài, với đánh giá dễ diễn giải và baseline bộ nhớ thực dụng.