EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
publication

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez
Conference on Neural Information Processing Systems. NeurIPS 2026.
Mesa de notícias do laboratório

Resumo do comunicado de imprensa

Esta seção foi escrita intencionalmente em tom de comunicado de imprensa, em estilo jornalístico, para o público geral.

Uma narrativa longa em vídeo exige que personagens, objetos e locais continuem reconhecíveis quando reaparecem. EntityBench mede esse desafio em 140 episódios e 2.491 tomadas, com agendas explícitas das entidades. A avaliação separa qualidade da tomada, aderência ao prompt e consistência entre tomadas, sem premiar aparições incorretas. O trabalho também apresenta EntityMem, que mantém referências visuais verificadas em memória persistente. Os experimentos mostram que a consistência cai à medida que aumenta a distância entre aparições, enquanto EntityMem alcança a maior fidelidade de personagens entre os métodos comparados.

resumo

Multi-shot video generation extends single-shot generation to coherent visual narratives, yet maintaining consistent characters, objects, and locations across shots remains a challenge over long sequences. Existing evaluations typically use independently generated prompt sets with limited entity coverage and simple consistency metrics, making standardized comparison difficult. We introduce EntityBench, a benchmark of 140 episodes (2,491 shots) derived from real narrative media, with explicit per-shot entity schedules tracking characters, objects, and locations simultaneously across easy / medium / hard tiers of up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, and recurrence gaps spanning up to 48 shots. It is paired with a three-pillar evaluation suite that disentangles intra-shot quality, prompt-following alignment, and cross-shot consistency, with a fidelity gate that admits only accurate entity appearances into cross-shot scoring. As a baseline, we propose EntityMem, a memory-augmented generation system that stores verified per-entity visual references in a persistent memory bank before generation begins. Experiments show that cross-shot entity consistency degrades sharply with recurrence distance in existing methods, and that explicit per-entity memory yields the highest character fidelity (Cohen's d = +2.33) and presence among methods evaluated.

citação

@inproceedings{he2026entitybench,
  title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation},
  author = {He, Ruozhen and Wei, Meng and Yang, Ziyan and Ordonez, Vicente},
  year = {2026},
  booktitle = {Conference on Neural Information Processing Systems. NeurIPS 2026},
  url = {https://arxiv.org/abs/2605.15199},
}

perguntas, principais contribuições e limitações deste artigo geradas automaticamente

Perguntas que este artigo ajuda a responder

  • O que o EntityBench mede? A consistência de personagens, objetos e locais em longas sequências de vídeo com múltiplas tomadas.
  • Qual é seu tamanho? 140 episódios e 2.491 tomadas, com até 50 tomadas e intervalos de recorrência de 48.
  • Como a consistência é avaliada? Qualidade, alinhamento ao prompt e consistência são medidos separadamente, e só aparições fiéis entram na pontuação.
  • O que é EntityMem? Uma baseline que armazena referências verificadas por entidade antes da geração e as reutiliza por toda a sequência.

Principais contribuições

  • EntityBench fornece agendas por tomada de personagens, objetos e locais derivados de mídia narrativa real.
  • Inclui três níveis, até 13 personagens, 8 locais e 22 objetos recorrentes.
  • A avaliação separa qualidade visual, alinhamento e consistência de longo alcance.
  • EntityMem oferece uma baseline de memória com forte vantagem em fidelidade de personagens.

Limitações e ressalvas

  • A origem narrativa pode não cobrir toda a consistência exigida por vídeos interativos ou documentais.
  • EntityMem pressupõe referências verificadas disponíveis antes da geração.
  • Movimento, cinematografia e continuidade causal são dimensões complementares futuras.
  • A queda em longas distâncias mostra que o problema permanece aberto e reforça o valor diagnóstico do benchmark.

Como interpretar este resultado

EntityBench é um banco de testes cuidadosamente estruturado para uma falha central da geração de vídeo longo, com avaliação interpretável e uma baseline prática.