NARU:1481 道日语长视频题,开源模型总体不到 40%

NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma

cs.CV, cs.AI, cs.MM

2026-08-13

东京大学等发布 NARU:155 部共 146.8 小时日语长视频、1481 道四选题,同时考叙事追踪和读空气。Gemini-3-Flash 总体 76.2%,开源最好 39.8%;潜台词一项 Flash 掉到 57.4%。

这篇在解决什么

长视频评测这两年被拆成两条线。一条看检索和时序定位,LongVideoBench、LVBench 这类;一条看故事线和角色连续性,VRBench、StoryVideoQA。文化与社交推理另起一摊,而且多数是短片段、英语主导。

真正难的是两件事叠在一起:跨半小时到四小时把人物、冲突、主题接住,再听懂没说出来的意思。监控录像可以很长,局部检测就够。日剧、综艺、纪录片不行,一句「再来杯咖啡」在日本语境里经常是送客。东京大学、九州大学和 Infinimind 的 NARU 把这种高上下文、非英语的长视频理解单独拎出来测。

方法

视频从 YouTube 16 个品类去重后超过 10 万条,ASR 筛日语得到 51643 条,再按 LVBench 标准留下至少 30 分钟的 8018 条。作者用日语检查视觉完整性和时间语义推进,去掉白噪音循环、静帧和无关联剪辑。再用标题和描述的 embedding 做贪心多样性采样,最终 155 条、146.8 小时,时长 30 到 240 分钟。

1481 道四选题均分在 9 个槽里。叙事 745 题:角色/实体演化 N.1、顺序/话题流 N.2、情节/冲突推进 N.3、主题发展 N.4。文化 736 题:相槌 C.1、读空气 C.2、潜台词 C.3、文化语境 C.4、情感与关系 C.5。

标注走分层记忆管线,主模型是 Gemini 2.5 Pro。视频切成约 5 分钟块,逐块写摘要、实体、事件和字幕,下一块带着前面的文字 recap;再做章节级语义切分;然后分别写叙事线和带时间戳的文化证据。基于这些注释出题,再跑一轮蒙眼去短路:看不到视频的 solver 如果能选对,critic 判断是语气偏好还是排除法,再改题干或干扰项,直到蒙眼正确率接近随机或用尽迭代。

人审两轮。40 名母语者看 1500 题候选,178 题判无效,修 161、扔 17;另 28 人看 refined 版,949 原样过、532 改、2 删。前后共 68 人。

结果

闭源走原生视频 API,Gemini 系 0.25 FPS,四小时视频大约 3600 帧。开源按窗口尽量稀疏采样,有的 64 帧,有的 128 帧,Qwen3-VL-8B 也报了 0.25 FPS。

模型采样叙事文化总体
Gemini-3-Flash0.25 FPS84.268.276.2
Gemini-3-Pro0.25 FPS74.166.070.0
Gemini-2.5-Flash0.25 FPS55.846.951.4
Qwen3.5-9B128 帧38.141.439.8
Qwen3-VL-8B0.25 FPS39.535.437.4
InternVL3.564 帧28.334.631.5
Qwen2.5-VL-7B128 帧31.128.229.7
MiniCPM-o-2.6128 帧30.828.329.6

随机基线 25%。Gemini 叙事比文化大约高 11 个点;开源两条线几乎一样差。选择题里 N.2 顺序流最好做。弱模型卡在 N.1 实体连续性,InternVL3.5 只有 20.0%,低于随机;强模型卡在 N.4 主题抽象。文化侧最难的是 C.3 潜台词:Flash 总体 76.2%,这一项 57.4%,也是 Pro 唯一反超 Flash 的槽。

同一 500 题子集上把帧数从 8 加到 128,Gemini-3-Pro 大约 64% 到 71%,Flash 53% 到 64%,2.5-Flash 39% 到 51%。开源里 Qwen3-VL-8B 从约 31% 到 38%,其余在 128 帧仍贴着 30%。叙事随帧数涨 1.4 到 20.5 个点,文化在 -3.9 到 +10.0 之间晃。缺帧能解释漏事件,解释不了读空气。受控帧预算里 Pro 一直压着 Flash,全量 0.25 FPS 时 Flash 反超(76.2 vs 70.0):低信息靠推理,高密度时 Flash 吃帧更狠。

去掉选项改成开放生成,GPT-5.5 按 FActScore 把参考答案拆成原子事实再算 recall。Gemini 家族 0.66 到 0.78,开源 0.21 到 0.56。选择题里最强的 N.2,开放题里变成八个模型中七个最弱的叙事槽:选项在替模型排时间线。叙事和文化的相对难度也对调,文化回答有 78.9% 至少命中一条事实,叙事只有 66.3%,因为文化题干常常先把互动场面铺出来。

为什么重要

做长视频 MLLM,不该只报「能检索到第 37 分钟那个物体」。NARU 把故事有没有接住、社交含义有没有读出来,绑在同一批小时级日语视频上。开源 7B 到 9B 档在这个设定里接近不好用,连实体连续性都能掉到随机以下。

即便把 Qwen3-VL-8B 也放到 0.25 FPS,总体仍只有 37.4%,比同采样的 Gemini-2.5-Flash 低 14 个点。鸿沟不全是帧预算。对做日语或东亚媒体理解的人,这 1481 题是可用的测试床;对只关心英语短视频的产品,绝对数字不能外推,但「选择题会讲顺序、开放题不会」这条警告是通用的。

局限与存疑

题目由 Gemini 2.5 Pro 生成,评测名单里又有 Gemini-2.5-Flash 和 Gemini-3。人审能挡住胡编,挡不住题型口味向 Gemini 家族倾斜。开源模型和 Gemini 的默认输入密度仍不对等,主表鸿沟里有一部分是看见的帧数。YouTube 来源会让基准随时效和版权慢慢烂掉。多样性采样看的是标题和描述,不是画面。文化槽绑在日本高上下文交际上,换到低上下文语言,C.2 和 C.3 会改味道。开放题裁判是 GPT-5.5,三人抽检 50 条、多数同意 96%,仍然是模型判模型。

术语

原文与代码

相关论文

全部论文解读