同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug
eyishazyer · x · 2026-09-11
博主在腾讯 Hy4 预览版测试后,用同一个 Echo Maze 游戏提示词横评了 Claude Fable 5.1、GPT-5.6 Luna 和 Gemini 3.6 Flash:
- Fable 5.1:表现最干净,墙体真实、幽灵回放路径准确、计数器与实际尝试一致
- Luna:初看最亮眼,但运行计数飙到 374 而金币只有 1/15——它在一秒内自我重置数百次,肉眼几乎发现不了
- Gemini 3.6 Flash:画面看起来是没有任何墙的平面网格
作者本以为是确认 Luna 的 bug,结果打开三个模型的实际代码后发现 Fable 也有同样的 bug;而 Gemini 的墙其实一直存在,只是两种颜色的色值在 255 色阶上只差 17,近到在屏幕上直接隐形。
结论:这三个模型几分钟就完成了人工需要一小时的任务,但仍然需要人工复查代码——「检查作业」环节依然不可省。
「编程与Agent」频道最新
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11