视频基准大多可被捷径攻破,新基准 Video-Index 840 题实测模型
thoma_gu · x · 2026-10-02
Jiatao Gu 团队发布 Video-Index,一个针对视频理解的元基准,核心发现是视频基准并非饱和,而是容易被刷分。团队提出 attack pyramid(五级捷径攻击)审计了 115 个视频基准、505K 道题:
- 35 个基准中,完全不看视频帧的攻击者就能接近全视频准确率;51 个含时序探测的基准里,打乱帧序仍保持中位数 96% 的准确率
- 63 个基准中近半以上是近重复题
- 最终从 76 个来源筛选出 840 道最难且经过验证的题目(按四类能力各 210 道)
在新基准上,Astra 达 79.3%,超过人类的 55%,而开源模型不足 20%;Claude Opus 5 领先最强开源模型 37 个百分点以上,加 agent 工具还能再涨约 20 分。论文、代码与数据集已开源。
「研究」频道最新
- SECRET 免训练法缓解音视频大模型跨模态幻觉,最高提升 18 个百分点 — Yu Zhang · 2026-10-02
- 美团 LongCat 提出 N-OPSD:邻近专家池自蒸馏,AIME 均值最高提升 2.75 分 — meituan-longcat · 2026-10-02
- DMM 迭代意图去噪解多智能体寻路,1600 任务解决 1598 并扩展到百万智能体 — Valeriy Vyaltsev · 2026-10-02
- ProVer 论文:让 LLM 裁判定位关键步骤,Agent RL 超 GRPO 9.9% — omarsar0 · 2026-10-02
- 哥本哈根大学招募无分词语言模型方向博士生,办公室设在植物园天文台 — delliott · 2026-10-02
- Memorizon:流式世界模型跨重访训练,长跨度只增 12% 步时成本 — MBZUAI-IFM · 2026-10-02