VIABench评测视障辅助能力
NJU · hf · 2026-07-17
研究团队提出 VIABench,这是一个面向视障辅助场景的综合视频基准,数据来自视障人士本人录制或分享的第一视角视频。它专门评估多模态大模型在真实辅助任务中的能力,覆盖三类核心任务:
- 主动提醒:识别视频中的持续内容,并提前提示即将到来的导航关键事件
- 视觉问答:回答用户对环境或物体的提问
- 引导式交互:在上下文中完成用户与环境之间的意图性交互
作者还设计了支持在线与离线两种评测方式的严谨流程。实验结果显示,当前多模态大模型在真实视障辅助上仍有明显不足,尤其是在需要提前判断和实时响应的主动提醒任务上。代码和数据将开源。
「多模态」频道最新
- H3 长视频实验:int8 32步渲染7小时,吃满192GB内存 — SIR_NVAX_A_LOT · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- RunningHub 开源 H3Lightning:MiniMax H3 视频生成提速约 12 倍 — 智东西 · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11