EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
Sintesi del comunicato stampa
Una lunga storia video richiede che personaggi, oggetti e luoghi restino riconoscibili quando ricompaiono. EntityBench misura questo problema in 140 episodi e 2.491 inquadrature, con programmi espliciti delle entità. La valutazione separa qualità dell’inquadratura, aderenza al prompt e coerenza tra inquadrature, escludendo le apparizioni errate. EntityMem conserva riferimenti visivi verificati per ogni entità in una memoria persistente. Gli esperimenti mostrano che la coerenza cala con la distanza di ricorrenza, mentre EntityMem ottiene la migliore fedeltà dei personaggi tra i metodi confrontati.
abstract
Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.
citazione
@article{heentitybench,
title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
journal = {arXiv preprint arXiv:2605.15199},
url = {https://arxiv.org/abs/2605.15199},
}
domande, principali contributi e limiti di questo articolo generati automaticamente
Domande a cui questo articolo aiuta a rispondere
- Che cosa misura EntityBench? La coerenza di personaggi, oggetti e luoghi in lunghe sequenze video multi-shot.
- Quanto è grande? 140 episodi e 2.491 inquadrature, fino a 50 shot e intervalli di ricorrenza di 48 shot.
- Come valuta la coerenza? Separa qualità, aderenza al prompt e coerenza, contando solo apparizioni fedeli.
- Che cos’è EntityMem? Una baseline che memorizza riferimenti verificati per ogni entità prima della generazione e li riutilizza nella sequenza.
Principali contributi
- EntityBench fornisce programmi per personaggi, oggetti e luoghi derivati da media narrativi reali.
- Comprende tre livelli e fino a 13 personaggi, 8 luoghi e 22 oggetti ricorrenti.
- La valutazione separa qualità, allineamento e coerenza a lungo raggio.
- EntityMem offre una baseline con memoria e un forte vantaggio nella fedeltà dei personaggi.
Limiti e avvertenze
- I dati derivano da media narrativi; video interattivi e documentari potrebbero richiedere altre forme di coerenza.
- EntityMem presuppone riferimenti verificati disponibili prima della generazione.
- Movimento, cinematografia e continuità causale sono dimensioni complementari future.
- Il calo sulle lunghe distanze conferma che il problema resta aperto e rende utile il benchmark.
Come interpretare questo risultato
EntityBench è un banco di prova ben strutturato per un limite centrale della generazione video lunga, con una valutazione interpretabile e una baseline pratica.