图表理解基准 Chartography 实测:缩放工具让 Claude 准确率翻倍
echen · x · 2026-07-28
SurgeAI 推出了名为 Chartography 的基准测试,专门用于评估模型对专业图表的读取和理解能力。
在针对密集型真实图表的 100 个问题测试中,Fable 5 和 Claude 3.5 Sonnet 的表现均显著提升:配合使用缩放工具后,Fable 5 的准确率从 29% 跃升至 73%,而 Sonnet 的准确率也从 13% 提升至 44%。
所属事件:Claude引入视觉缩放工具,图表识别准确率大幅飙升(3 条相关)→
「模型」频道最新
- Kimi K3 在利用开发上胜过 GLM-5.2,但端到端仍未攻成 — kevinsxu · 2026-07-28
- 大模型更像“智慧”,推理努力更像“勤奋” — breath_mirror · 2026-07-28
- 微软发布自研AI安全模型,关键测试超越GPT且成本减半 — MichaelFNunez · 2026-07-28
- 实测对比:K3等模型推理token极易耗尽预算 — MaziyarPanahi · 2026-07-28
- 端侧实测:Nanbeige4.2-3B 的 KV Cache 效率远低于 Qwen MoE — TechTefa · 2026-07-28
- 35B 模型智能体实测:KAT-Coder 以一半 Token 消耗追平 Qwen — IvGranite · 2026-07-28