EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
preprint

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez
arXiv:2605.15199
Rubrique actualités du laboratoire

Résumé du communiqué de presse

Cette section est volontairement rédigée dans le style d'un communiqué de presse, sur un ton journalistique, à destination du grand public.

Une longue histoire vidéo exige que personnages, objets et lieux restent reconnaissables lorsqu’ils réapparaissent. EntityBench mesure ce défi sur 140 épisodes narratifs et 2 491 plans, avec un calendrier explicite des entités attendues. L’évaluation sépare qualité du plan, respect du prompt et cohérence entre plans, sans accorder de crédit aux apparitions incorrectes. Le travail propose aussi EntityMem, qui conserve en mémoire des références visuelles vérifiées pour chaque entité. Les expériences montrent que la cohérence des méthodes existantes baisse avec l’écart entre réapparitions, tandis qu’EntityMem obtient la meilleure fidélité des personnages parmi les méthodes comparées.

résumé

Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.

citation

@article{heentitybench,
  title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
  author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
  journal = {arXiv preprint arXiv:2605.15199},
  url = {https://arxiv.org/abs/2605.15199},
}

questions, principales contributions et limites de cet article générées automatiquement

Questions auxquelles cet article aide à répondre

  • Que mesure EntityBench ? La cohérence des personnages, objets et lieux dans de longues séquences vidéo multi-plans.
  • Quelle est sa taille ? 140 épisodes et 2 491 plans, jusqu’à 50 plans et 48 plans d’écart entre réapparitions.
  • Comment la cohérence est-elle évaluée ? Qualité intra-plan, alignement au prompt et cohérence inter-plans sont séparés, avec un filtre qui ne retient que les apparitions fidèles.
  • Qu’est-ce qu’EntityMem ? Une baseline qui stocke avant la génération des références visuelles vérifiées pour chaque entité et les réutilise pendant toute la séquence.

Principales contributions

  • EntityBench fournit des calendriers par plan pour personnages, objets et lieux issus de médias narratifs réels.
  • Il comprend trois niveaux et jusqu’à 13 personnages, 8 lieux et 22 objets récurrents par épisode.
  • Son évaluation distingue qualité visuelle, suivi du prompt et cohérence à longue portée.
  • EntityMem offre une baseline à mémoire qui obtient un net avantage de fidélité des personnages.

Limites et mises en garde

  • Les épisodes viennent de médias narratifs ; les vidéos interactives ou documentaires pourraient exiger d’autres formes de cohérence.
  • EntityMem suppose des références vérifiées disponibles avant la génération.
  • Le benchmark privilégie entités et lieux ; mouvement, mise en scène et continuité causale sont complémentaires.
  • La baisse à longue distance confirme que la vidéo longue cohérente reste ouverte et souligne l’utilité diagnostique du benchmark.

Comment interpréter ce résultat

EntityBench est un banc d’essai soigneusement structuré pour une faiblesse centrale de la génération vidéo longue, accompagné d’une évaluation interprétable et d’une baseline pratique.