EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
preprint

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez
arXiv:2605.15199
Новостная редакция лаборатории

Краткое изложение пресс-релиза

Этот раздел намеренно написан в стиле журналистского пресс-релиза для широкой аудитории.

В длинном видеорассказе персонажи, объекты и места должны оставаться узнаваемыми при повторном появлении. EntityBench измеряет эту задачу на 140 эпизодах и 2 491 кадре с явными расписаниями сущностей. Оценка разделяет качество кадра, соответствие запросу и межкадровую согласованность, не засчитывая ошибочные появления. EntityMem хранит проверенные визуальные эталоны каждой сущности в постоянной памяти. Эксперименты показывают падение согласованности с ростом интервала между появлениями, тогда как EntityMem обеспечивает лучшую сохранность персонажей среди сравниваемых методов.

аннотация

Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.

цитирование

@article{heentitybench,
  title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
  author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
  journal = {arXiv preprint arXiv:2605.15199},
  url = {https://arxiv.org/abs/2605.15199},
}

автоматически сгенерированные вопросы, основные вклады и ограничения этой статьи

Вопросы, на которые помогает ответить эта статья

  • Что измеряет EntityBench? Согласованность персонажей, объектов и мест в длинных многокадровых видеопоследовательностях.
  • Каков размер набора? 140 эпизодов и 2 491 кадр, до 50 кадров и интервалов повторения в 48 кадров.
  • Как оценивается согласованность? Качество, соответствие запросу и согласованность измеряются отдельно; учитываются только верные появления.
  • Что такое EntityMem? Базовый метод, который до генерации сохраняет проверенные эталоны каждой сущности и использует их во всей последовательности.

Основные вклады

  • EntityBench предоставляет покадровые расписания персонажей, объектов и мест из реальных повествовательных материалов.
  • Он включает три уровня сложности и до 13 персонажей, 8 мест и 22 повторяющихся объектов.
  • Оценка разделяет визуальное качество, соответствие запросу и дальнюю согласованность.
  • EntityMem служит базовым методом с памятью и заметно улучшает сохранность персонажей.

Ограничения и предостережения

  • Повествовательные источники могут не охватывать все требования интерактивного или документального видео.
  • EntityMem предполагает наличие проверенных эталонов до генерации.
  • Движение, операторская работа и причинная непрерывность остаются дополнительными измерениями.
  • Падение на больших интервалах показывает открытость задачи и диагностическую ценность бенчмарка.

Как интерпретировать этот результат

EntityBench — тщательно организованный тест центральной проблемы длинной видеогенерации с интерпретируемой оценкой и практичным базовым методом памяти.