繁体中文视觉基准 VisTW:你的 VLM 读得懂台湾街景和考卷吗

piske_usagi · reddit · 2026-09-16

主流 VLM 评测(MMBench、MMMU、POPE 等)全是英文或简体中文,模型可能在台湾路牌、发票、健保卡、本地课本图示上翻车。台大 MiuLab 的 VisTW(arXiv 2503.10427,CC BY 4.0)补上这个缺口:VisTW-MCQ 含 4,770 道来自 21 个学科真实考试的繁体选择题(图表、电路图、乐谱、医学影像、地图);VisTW-Dialogue 含 141 道关于台湾日常场景的开放题,由 LLM 评分 0-10。官方榜单上 gemma-3-12b-it MCQ 0.4863、Dialogue 3.94,o3 居首约 0.7769/6.9878(榜单自 2025 年 4 月未更新)。作者团队在开源评测框架 Twinkle Eval(v2.10.0)中加入 VisTW 支持,与官方实现对齐后对账:同模型同 endpoint 抽样 253 题,准确率 81.01% vs 80.56%。对齐过程还揪出一个坑:官方 prompt 要求模型输出「答案: $字母」,模型照抄美元符号导致其抽取器失配、回退到宽松模式从推理文本里乱抓字母,把正确答案判错——某学科因此被压低 36 分,且该 bug 波及 5 个视觉基准,21 题冒烟测试完全发现不了。其他实用提醒:他们不复制官方用 LLM 兜底解析响应的做法,改为报告 unparsedrate 保持可见;推理型 VLM 在 maxtokens 2048 下有 19% 响应在答案前被截断,损失 19 分精度,模板默认 8192。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →