EM²Mem: event-centric multimodal memory for long-video QA

zjunlp · hf · 2026-09-02

ZJUNLP proposes EM²Mem, which binds multimodal evidence to event anchors for compact, generation-ready memory, improving long-video question answering.

Original post →

More from Research

Research channel →