EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
preprint

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez
arXiv:2605.15199
Mesa de noticias del laboratorio

Resumen de prensa

Esta sección está escrita intencionadamente con un tono de nota de prensa, en estilo periodístico, para el público general.

Generar una historia larga en video no consiste solo en crear tomas atractivas: los personajes, objetos y lugares deben seguir siendo reconocibles cuando reaparecen mucho después. EntityBench introduce un benchmark para medir este problema en 140 episodios narrativos y 2.491 tomas, con calendarios explícitos de las entidades que deben reaparecer. Su evaluación separa la calidad de cada toma, el seguimiento del prompt y la consistencia entre tomas, evitando premiar como consistente una aparición incorrecta. El trabajo también presenta EntityMem, un baseline que conserva referencias visuales verificadas de cada entidad en una memoria persistente. Los experimentos muestran que los métodos existentes pierden consistencia cuando crece la distancia entre apariciones, mientras que el enfoque con memoria logra la mayor fidelidad de personajes entre los métodos comparados.

resumen

Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.

cita

@article{heentitybench,
  title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
  author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
  journal = {arXiv preprint arXiv:2605.15199},
  url = {https://arxiv.org/abs/2605.15199},
}

preguntas, contribuciones principales y limitaciones de este artículo generadas automáticamente

Preguntas que ayuda a responder este artículo

  • ¿Qué mide EntityBench? Evalúa si los generadores de video con múltiples tomas mantienen consistentes los personajes, objetos y lugares a lo largo de secuencias narrativas extensas.
  • ¿Qué tamaño tiene el benchmark? Contiene 140 episodios y 2.491 tomas, con escenarios de hasta 50 tomas y separaciones de hasta 48 tomas entre apariciones.
  • ¿Cómo se evalúa la consistencia? El conjunto mide por separado la calidad de cada toma, la alineación con el prompt y la consistencia entre tomas, y usa un filtro de fidelidad para contar solo apariciones correctas.
  • ¿Qué es EntityMem? Es un baseline con memoria que almacena referencias visuales verificadas de cada entidad antes de generar y las utiliza durante toda la secuencia.

Contribuciones principales

  • EntityBench proporciona calendarios por toma para personajes, objetos y lugares derivados de medios narrativos reales.
  • El benchmark incluye niveles fácil, medio y difícil, con hasta 13 personajes, 8 lugares y 22 objetos recurrentes por episodio.
  • La evaluación en tres pilares separa calidad visual, alineación con el prompt y consistencia de entidades a largo plazo.
  • EntityMem ofrece un baseline basado en memoria y obtiene en los experimentos una gran ventaja de fidelidad de personajes frente a las alternativas evaluadas.

Limitaciones y advertencias

  • El benchmark se deriva de medios narrativos; trabajos futuros podrían comprobar si sus calendarios capturan toda la consistencia necesaria en videos interactivos o documentales.
  • EntityMem requiere referencias verificadas antes de la generación, por lo que obtener esas referencias es una consideración práctica importante.
  • El benchmark prioriza personajes, objetos y lugares; el estilo de movimiento, la cinematografía y la continuidad causal son dimensiones complementarias para el futuro.
  • La degradación a grandes distancias muestra que el video largo consistente sigue siendo un problema abierto y hace de EntityBench una herramienta diagnóstica valiosa.

Cómo interpretar este resultado

EntityBench debe interpretarse como un banco de pruebas cuidadosamente diseñado para un fallo central de la generación de video largo, con una evaluación interpretable y un baseline práctico de memoria.