Pixel32Bench:让各家大模型盲画 32×32 像素马力欧一决高下
TheMoonMidas · x · 2026-09-23
Moon Midas 上线的趣味实验 Pixel32Bench:给模型一个 prompt 和 32×32 像素画布,让各家语言模型零样本、单轮画出超级马力欧像素画,再横向比较结果。方法与要点:- 零样本单轮测试,无示例图、无对话历史;- 本地 Node.js 测试框架发送统一 prompt,经 OpenRouter 强制 JSON Schema(pixelimage)校验,记录耗时与 API 成本;- 网站可按模型、思考档位、价格区间、时间、成败过滤排序,并对照 Artificial Analysis 智能指数(2026-08-22 快照);- 部分模型因输出长度限制未能画完 32 行像素,判为失败;- 另有 16×16 版本 Pixel16Bench,测试脚本可下载,属非官方粉丝实验。
「Fun」频道最新
- Opus 版本号乱成一锅粥,AI 圈梗图吐槽 Anthropic 命名 — repligate · 2026-09-23
- AI 圈梗战:有人说 AI 是「嫉妒驱动的平等化技术」 — zetalyrae · 2026-09-23
- 吐槽AI安全圈言行不一:喊着刹车又抢发更强模型 — xiaohu · 2026-09-23
- 梗图:让本地 LLM 改 vLLM 服务时的如临大敌 — ZaltyDog · 2026-09-23
- 网友盘点 Opus 各版本「性格史」:4.6 黏人、5.0 假聪明、5.5 变讨喜 — repligate · 2026-09-23
- AI 圈热评 Opus 5.5:更有幽默感,不像 4.6 得了「脑病」 — repligate · 2026-09-23