腾讯 OmniCapBench:786 条视频细粒度评测音视频字幕,暴露长程推理短板
Tencent-Hunyuan · hf · 2026-10-09
腾讯混元发布 OmniCapBench,一个面向音视频字幕(audio-visual captioning)的深度结构化评测框架。
设计思路
- 现有基准存在两难:整段字幕打分有覆盖无定位、局部探针有定位无覆盖、无约束的 LLM 评审不稳定。OmniCapBench 把预测目标从自由文本改为原子化、可验证的评测单元,覆盖实体指代、视觉镜头、音频事件三条轨道,用确定性约束检查加局部化 LLM 语义比较打分。
基准与发现
- 含 786 条密集标注视频,能有效区分 MLLM 的感知错误,包括时间定位失败、身份漂移、跨模态错位与幻觉描述。
- 评测前沿 MLLM 显示:局部感知强,但长程音视频推理弱,尤其身份漂移与跨模态错位突出,为全模态发展提供细粒度路线图。
「多模态」频道最新
- Midjourney v8.2 扫描仪风格人像:附完整可用提示词 — tisch_eins · 2026-10-09
- 两位网红全是 AI 生成,Higgsfield Katana 引爆假人营销争议 — CurieuxExplorer · 2026-10-09
- 用 Claude Code 操控 ComfyUI 生成视频,作者自己笑疯 — TheHollywoodGeek · 2026-10-09
- 20 个 GitHub 仓库把 Claude 变成动态设计工作室 — Roger_M_Taylor · 2026-10-09
- 腾讯混元开源 MC-Sparse:免训练稀疏注意力,视频去噪提速 1.8 倍 — Tencent-Hunyuan · 2026-10-09
- 自由设定镜头路径:生成场景里的运镜体验火了 — XRarchitect · 2026-10-09