一个评测 VLM 画 ASCII 的新基准
East-Muffin-6472 · reddit · 2026-07-19
这是一个名为 ASCIITermDraw-Bench 的新基准,用来测试 VLM 是否真的能按要求生成和编辑 ASCII 图。
作者的动机是:很多模型能“说”出架构图或拓扑图长什么样,但把这些内容准确排成 ASCII 文本,是另一种更难的能力。为此基准设计了 80 个任务,覆盖四类场景:
- 基础方框和布局
- 网络拓扑
- 软件架构图
- 图像条件下的 ASCII 编辑(在保留未要求部分的前提下修改图)
评测方式也比较完整:
- 结构分数:检查必要的标签、边、实体和关系是否正确
- 语义分数:用 LLM judge 评估,并对每个任务重复 5 次以减少波动
- 最终汇总 80 个任务 的结果,并给出 95% 置信区间
当前榜单里,Gemma-4-31B-IT 以 73.8% 领先,其后是 Qwen3.7-Plus(70.2%)、Kimi-K2.6(61.8%)、MiniMax-M3(59.5%)等。项目公开了 12 个示例任务和完整方法,作者也提供了 Hugging Face 上可复现的内容。
所属事件:ASCIITermDraw-Bench评测VLM画ASCII图(2 条相关)→
「多模态」频道最新
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11