CineSubBench:用 1012 部电影字幕考 LLM 长叙事与文化理解
Mir Tafseer Nayeem · hf · 2026-09-30
新基准 CineSubBench 用多语言电影字幕评估 LLM 的长上下文叙事与文化理解——现有评测多集中在法律、医学、代码等领域,电影长期被忽视。
- 规模:1012 部电影,6 种语言完整字幕,共 6072 条字幕轨、813 万条带时间戳字幕条目;模型需从数千条短对白中重建人物、关系、事件、因果与主题。
- 任务:7 项任务覆盖叙事重建与抽象、类型预测、年龄适宜性、10 国分级体系的国家特定评分、字幕依据的语言安全性判断,形成多任务多语言多文化(MultiX)统一评测。
- 九个 LLM 的发现:模型对情节梗概的还原比对完整事件概要更可靠;跨语言一致性因模型与语言差异显著;不同国家分级体系暴露不同的校准模式;强脏话远比轻度粗俗语更易被识别。
该基准将电影确立为长上下文 LLM 评测领域。
「研究」频道最新
- 多机构联办研究 Agent 竞赛:无人类监督自主完成后训练 — my_cat_can_code · 2026-09-30
- AI 生成合金微结构:边缘损失+结构相似度损失保住晶界物理意义 — bravo_abad · 2026-09-30
- SOSP26 论文 YoloFS:290 起智能体误删文件报告催生 Agent 原生文件系统 — tianyin_xu · 2026-09-30
- 新论文:Claude Code、Codex 等 Agent 可随意篡改自身执行日志 — maksym_andr · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- AnyStep-WAM:按任务难度自适应分配去噪步数,平均省 60% 步数不掉成功率 — Rui Wang · 2026-09-30