ASCIITermDraw 基准测试模型能否用 ASCII 画图改图
East-Muffin-6472 · reddit · 2026-07-22
这条帖子介绍了一个新基准 ASCIITermDraw-Bench,目标是评估 VLM/LLM 是否真的会用纯 ASCII 生成和编辑图示。
- 作者的动机是:人和 AI 之间,想可靠地表达架构/拓扑/集群草图,当前最实用的标准通道就是 ASCII 和 Mermaid。
- 基准覆盖 80 个任务,分为四类:基础方框与布局、网络拓扑、软件架构图、以及“给定图片后做 ASCII 编辑”。
- 评估方法也比较严谨:先做结构检查,再用 LLM judge 评语义,并且每题评五次,最后给出 95% 置信区间。
- 目前榜单上,Gemma-4-31B-IT 以 73.8% ± 4.1 领先,Qwen3.7-Plus 以 70.2% ± 4.6 紧随其后。
- 项目还公开了 12 个示例题和完整方法,方便直接复现。
所属事件:ASCIITermDraw 基准测试模型生成与编辑 ASCII 图能力(2 条相关)→
「研究」频道最新
- 视频课程讲解物理约束机器学习的建模与控制 — Vjeux · 2026-07-22
- 健康时间序列基准显示 LLM 仍落后传统机器学习 — yang_yuzhe · 2026-07-22
- AutoLab 基准显示前沿模型靠持续迭代赢下长任务 — rohanpaul_ai · 2026-07-22
- 报告称 Gemini Flash 持平能力、成本降 30–40% — sujingshen · 2026-07-22
- Delineate Anything v2 用 7300 万实例数据集做全球农田边界识别 — Mykola Lavreniuk · 2026-07-22
- KernelBench 新增 CUDA 子基准,并在三种 GPU 上重跑 Fable — TheZachMueller · 2026-07-22