一个评测 VLM 画 ASCII 的新基准
East-Muffin-6472 · reddit · 2026-07-19
这是一个名为 ASCIITermDraw-Bench 的新基准,用来测试 VLM 是否真的能按要求生成和编辑 ASCII 图。
作者的动机是:很多模型能“说”出架构图或拓扑图长什么样,但把这些内容准确排成 ASCII 文本,是另一种更难的能力。为此基准设计了 80 个任务,覆盖四类场景:
- 基础方框和布局
- 网络拓扑
- 软件架构图
- 图像条件下的 ASCII 编辑(在保留未要求部分的前提下修改图)
评测方式也比较完整:
- 结构分数:检查必要的标签、边、实体和关系是否正确
- 语义分数:用 LLM judge 评估,并对每个任务重复 5 次以减少波动
- 最终汇总 80 个任务 的结果,并给出 95% 置信区间
当前榜单里,Gemma-4-31B-IT 以 73.8% 领先,其后是 Qwen3.7-Plus(70.2%)、Kimi-K2.6(61.8%)、MiniMax-M3(59.5%)等。项目公开了 12 个示例任务和完整方法,作者也提供了 Hugging Face 上可复现的内容。
所属事件:ASCIITermDraw-Bench评测VLM画ASCII图(2 条相关)→
「多模态」频道最新
- AI 视频制作入坑指南:如何解决连贯性与审查限制 — cynicalnewenglander · 2026-07-22
- 先做分镜再生成,AI 舞蹈视频更容易保持一致性 — aftahi_ai · 2026-07-22
- Runpod MCP 让 Claude 直接编排图像和视频生成工作流 — 802high · 2026-07-22
- Midjourney 把蜜蜂做成碎片爆炸梗图 — michaelrabone · 2026-07-22
- 物理奖励能改进视频生成,但不等于物理引擎 — Dapper-Drawer4546 · 2026-07-22
- HeyGen 给 coding agent 接入 7.5 万图片和 1 万音乐 — HeyGen · 2026-07-22