多模态上下文学习评测基准 CLBench-V 发布,最强模型得分不足 0.3

Lai Wei · hf · 2026-07-30

现有评估多聚焦于文本,而现实任务常需模型从图表、网页等多模态上下文中学习。为此,研究者提出了 CLBench-V 基准,将任务分为上下文定位、新信息应用和新知识学习三个维度。

该基准涵盖科学、金融、长文档和空间推理等领域,共 3,443 个实例。对 6 个最新多模态模型的测试显示,最高总分仅为 0.2847,表明该能力远未饱和。其中,InternVL3.5-30B-A3B 在上下文定位和新知识学习上表现最佳,而 Qwen3.5-Plus 在新信息应用上领先。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →