EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
preprint

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez
arXiv:2605.15199
Mesa de notícias do laboratório

Resumo do comunicado de imprensa

Esta seção foi escrita intencionalmente em tom de comunicado de imprensa, em estilo jornalístico, para o público geral.

Uma narrativa longa em vídeo exige que personagens, objetos e locais continuem reconhecíveis quando reaparecem. EntityBench mede esse desafio em 140 episódios e 2.491 tomadas, com agendas explícitas das entidades. A avaliação separa qualidade da tomada, aderência ao prompt e consistência entre tomadas, sem premiar aparições incorretas. O trabalho também apresenta EntityMem, que mantém referências visuais verificadas em memória persistente. Os experimentos mostram que a consistência cai à medida que aumenta a distância entre aparições, enquanto EntityMem alcança a maior fidelidade de personagens entre os métodos comparados.

resumo

Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.

citação

@article{heentitybench,
  title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
  author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
  journal = {arXiv preprint arXiv:2605.15199},
  url = {https://arxiv.org/abs/2605.15199},
}

perguntas, principais contribuições e limitações deste artigo geradas automaticamente

Perguntas que este artigo ajuda a responder

  • O que o EntityBench mede? A consistência de personagens, objetos e locais em longas sequências de vídeo com múltiplas tomadas.
  • Qual é seu tamanho? 140 episódios e 2.491 tomadas, com até 50 tomadas e intervalos de recorrência de 48.
  • Como a consistência é avaliada? Qualidade, alinhamento ao prompt e consistência são medidos separadamente, e só aparições fiéis entram na pontuação.
  • O que é EntityMem? Uma baseline que armazena referências verificadas por entidade antes da geração e as reutiliza por toda a sequência.

Principais contribuições

  • EntityBench fornece agendas por tomada de personagens, objetos e locais derivados de mídia narrativa real.
  • Inclui três níveis, até 13 personagens, 8 locais e 22 objetos recorrentes.
  • A avaliação separa qualidade visual, alinhamento e consistência de longo alcance.
  • EntityMem oferece uma baseline de memória com forte vantagem em fidelidade de personagens.

Limitações e ressalvas

  • A origem narrativa pode não cobrir toda a consistência exigida por vídeos interativos ou documentais.
  • EntityMem pressupõe referências verificadas disponíveis antes da geração.
  • Movimento, cinematografia e continuidade causal são dimensões complementares futuras.
  • A queda em longas distâncias mostra que o problema permanece aberto e reforça o valor diagnóstico do benchmark.

Como interpretar este resultado

EntityBench é um banco de testes cuidadosamente estruturado para uma falha central da geração de vídeo longo, com avaliação interpretável e uma baseline prática.