新基准显示,最强 VLM 仍画不准纯文本示意图

East-Muffin-6472 · reddit · 2026-07-23

新基准显示,最强 VLM 画纯文本图仍不稳

一位 Reddit 用户发布了 ASCIITermDraw-Bench 的结果,这是一个测试模型能否用纯文本画出简单示意图的 benchmark。结论很直接:即便是当前最强模型,也很难稳定完成这种看似基础的任务。

80 个任务的榜单前列

作者的判断是:最好的模型仍然会错掉接近 1/4 的任务。结构识别看起来还行,但一旦要求布局、间距和连线关系正确,性能就明显下滑。

他认为这不是冷门学术游戏,而是人机协作里很基础的能力:能否不用截图、也不用 Mermaid,就把架构和拓扑准确表达出来。这个 benchmark 也顺带抛出一个问题:VLM 里的“vision”到底有多少在高精度场景下是真正可靠的?

所属事件:新基准测试揭示最强VLM仍画不准ASCII图(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →