新基准显示,最强 VLM 仍画不准纯文本示意图
East-Muffin-6472 · reddit · 2026-07-23
新基准显示,最强 VLM 画纯文本图仍不稳
一位 Reddit 用户发布了 ASCIITermDraw-Bench 的结果,这是一个测试模型能否用纯文本画出简单示意图的 benchmark。结论很直接:即便是当前最强模型,也很难稳定完成这种看似基础的任务。
80 个任务的榜单前列
- qwen3.7-max:77.2% ±4.0
- gemma-4-31b-it:73.8% ±4.1
- glm-5.2:70.6% ±5.0
- qwen3.7-plus:70.2% ±4.6
- deepseek-v4-pro:68.0% ±4.7
- kimi-k2.6:61.8% ±6.0
- kimi-k2.7-code:61.6% ±7.0
- minimax-m3:59.5% ±6.3
- nemotron-3-ultra-550b-a55b:57.4% ±6.8
作者的判断是:最好的模型仍然会错掉接近 1/4 的任务。结构识别看起来还行,但一旦要求布局、间距和连线关系正确,性能就明显下滑。
他认为这不是冷门学术游戏,而是人机协作里很基础的能力:能否不用截图、也不用 Mermaid,就把架构和拓扑准确表达出来。这个 benchmark 也顺带抛出一个问题:VLM 里的“vision”到底有多少在高精度场景下是真正可靠的?
所属事件:新基准测试揭示最强VLM仍画不准ASCII图(3 条相关)→
「研究」频道最新
- TPAMI 论文统一了 Bregman 距离与学习 surrogate loss — FrnkNlsn · 2026-07-23
- Nathan Benaich 认为,未来几乎所有分子都会由 AI 设计 — nathanbenaich · 2026-07-23
- 没有混淆矩阵,AI 内容检测器几乎像抛硬币 — JeremyNguyenPhD · 2026-07-23
- DocOps 基准显示,前沿智能体仍难做好长链路文档操作 — Jiazhen Jiang · 2026-07-23
- 斯坦福软体机器人像藤蔓一样生长,专为救援狭窄空间设计 — lukas_m_ziegler · 2026-07-23
- 全球首个实体瘤 CAR-T 疗法获批,用于胃癌治疗 — Dr_Singularity · 2026-07-23