多模态上下文学习评测基准 CLBench-V 发布,最强模型得分不足 0.3
Lai Wei · hf · 2026-07-30
现有评估多聚焦于文本,而现实任务常需模型从图表、网页等多模态上下文中学习。为此,研究者提出了 CLBench-V 基准,将任务分为上下文定位、新信息应用和新知识学习三个维度。
该基准涵盖科学、金融、长文档和空间推理等领域,共 3,443 个实例。对 6 个最新多模态模型的测试显示,最高总分仅为 0.2847,表明该能力远未饱和。其中,InternVL3.5-30B-A3B 在上下文定位和新知识学习上表现最佳,而 Qwen3.5-Plus 在新信息应用上领先。
「模型」频道最新
- 实测 OpenRouter 全线 TTS:Kokoro-82M 长文本最佳且最便宜 — nathanborror · 2026-07-30
- Qwen3.6 MoE 2-bit 量化版登顶 Hugging Face 趋势榜 — EschaLabs · 2026-07-30
- 泄露任务揭示 Anthropic 训练机制:用人类轨迹训练裁判模型 — burny_tech · 2026-07-30
- 用户盛赞 Grok 4.5:生成速度极快,一旦习惯便无法回头 — XFreeze · 2026-07-30
- 342GB 剪枝版 Kimi K3 量化模型好用吗? — Hannibalj2ca · 2026-07-30
- OpenAI 官方预告 Codex 新更新,社区猜测将主打提速降本 — haider1 · 2026-07-30