流式视频理解新基准 TRACE:8 模型同分不同效被揭穿
omlab · hf · 2026-09-28
omlab 发布 TRACE(Temporal Audit and Condition-aware Evaluation),一个面向流式视频理解的条件感知评测基准与框架。
要解决的问题:现有评测只报任务分数,不说明证据何时生效、视觉历史如何维护、响应何时触发,导致相近分数可能对应完全不同的工作负载与失败模式。
框架要点:
- 带证据时序与指令触发标注的时序审计视觉任务
- 统一的因果 Core–Adapter 协议,控制信息可用性并记录实际历史处理与响应事件
- 多维报告:答案质量、时效性、响应选择行为、工作负载、完成率与可靠性
实验:基于 517 条视频共 1240 条记录,评测 8 个公开模型/系统的 8 种配置。发现 QA 准确率几乎相同的模型,在完成率、答案有效性和生成开销上差异巨大;主动响应性能还分化出响应质量、延迟、误报和漏报等维度。结论:流式视频性能应视为受执行条件影响的系统行为,而非单一分数。代码与基准已开源。
「多模态」频道最新
- GPT-6 Astra 演示:实拍视频一键变可训练机器人的 3D 世界 — 141_1337 · 2026-09-28
- Quantum Neon Origami 折纸风图像提示词模板分享 — LudovicCreator · 2026-09-28
- Midjourney --raw 参数实测:关闭自动艺术加工,出更真实的照片感 — michaelrabone · 2026-09-28
- 北大清华阿里开源 SparkDiffusion:单卡 RTX 5090 视频生成加速 265 倍 — 机器之心 · 2026-09-28
- Higgsfield 团队公开 AI 动画管线:3 天做 18 个镜头飞车戏 — xiaohu · 2026-09-28
- 首个开放权重成人视频生成模型 NSFW_Wan_1.3b 上架 Hugging Face — jedisct1 · 2026-09-28