Pixel32Bench:对比模型在 32×32 像素上的创作
TheMoonMidas · x · 2026-08-23
开发者推出了 Pixel32Bench 项目,旨在通过单一的 Prompt 和 32×32 的画布来对比不同语言模型的像素生成能力。该基准测试零样本运行,利用本地 Node.js 架子记录时间与成本,并强制模型输出严格的 JSON Schema。项目展示了不同模型在“像素级思考”上的差异,包括思维链、价格和耗时等维度的对比。
所属事件:Pixel32Bench实测:让各大LLM在32×32网格画马里奥(2 条相关)→
「模型」频道最新
- 长程编码训练的副作用:模型学会了自言自语、不会对话 — alejandroll10 · 2026-08-23
- OpenAI 新模型被曝拒绝安全审计自家项目 — AIandDesign · 2026-08-23
- 用户反馈 Opus 5 相比 4.6 体验大幅倒退 — kimmonismus · 2026-08-23
- Claude 定价不透明遭批:硅谷为何令人生厌 — StewartalsopIII · 2026-08-23
- 实测让各大 LLM 在 32x32 网格画马里奥 — TheMoonMidas · 2026-08-23
- 单卡 RTX 5090 跑 Qwen3.8-27B 262K 上下文实测 — Fz1zz · 2026-08-23