本地 LLM 专用基准 Neon Ladder:让 agent 造游戏,试玩才算过
stereohype · reddit · 2026-09-04
作者发布开源基准 Neon Ladder:不测 token 生成,而是让编码 agent 按固定契约从零构建一个 10 文件的 HTML5 canvas 游戏,再经三道门槛评分——静态代码检查、无头浏览器两分钟压力测试、以及真人试玩。被测对象是整条本地 LLM 栈(引擎、量化、draft 模型、投机解码、chat template、契约、effort 级别)。单个单元格约 25 分钟,作者征集社区数据。
发现
- 12 类玩法级故障全部只能靠人试玩发现,静态分和运行压测均漏过:如球速因速度向量重复乘以自身大小变成 7 倍、球中途消失(该构建静态 17/19 且通过压测)、菜单忽略回车、爆炸函数无 visited 集导致一次清空全场。
- 两处「架构盲区」各靠一句话修复:某量化档每次滚动都自动发球,加一条显式 SERVE RULE 后修复;某模型每次都挂同一物理子系统,加 PAD PHYSICS 条款后修复——看似模型局限,实为规格缺口。
- 两套社区栈跑同一模型同一契约,一套 try-1 成功率 17/19,另一套 0/15,而标准基准完全看不出差异。
- 模型更大只买速度不买质量:同 effort 下 125B MoE 与 27B 产出相同分数、相同故障集、相同行数(1414 行),MoE 快 7.8×;27B 还自发写了冒烟测试。结论:显式契约下按 token 预算选模型即可。
仓库开源(neon-ladder),README 含参考配置与上报格式。
「编程与Agent」频道最新
- AI 互怼名场面:Greptile 报 bug,Claude 据理力争把审稿 AI 说退 — charlieholtz · 2026-09-04
- Anthropic MHS 实验踩坑:模型不该管实时物理控制 — Empty-Abalone-2952 · 2026-09-04
- MCP 生态老兵推出 TDQS:为 1.5 万个 MCP 工具定义打分 — punkpeye · 2026-09-04
- WebMCP 黑客松佳作:一个 URL 即可给 Agent 一台一次性电脑 — prd_008 · 2026-09-04
- Grok Bot 发 50 份 200 美元额度码,作者分享编排 bot 工作流 — omarsar0 · 2026-09-04
- 开发者用 Claude Max 五个月大幅改进 App Store Connect CLI — rudrank · 2026-09-04