43 个 LLM 拼数独类谜题:GPT-6 Astra 首个满分,开源模型 Hard 模式全军覆没
mauricekleine · reddit · 2026-09-27
作者发布 Nonobench v1.2,用 nonogram 逻辑谜题测试 43 个 LLM,prompt 与全部输出公开。
主要结果:
- GPT-6 Astra 在 15×15 谜题上 30/30 满分,是该测试首个满分。
- 开源最佳为 DeepSeek V4 Pro(83%,并列第 4);DeepSeek V4.1 Flash 拿到 77% 仅花 $0.84。
- 新增 20×20 Hard 模式(10 道唯一解谜题,按行作答以避免此前发现的 400 字符计数问题):Claude Opus 5.5 拿 8/10,所有开源模型 0/10。
此前社区发现 Grok 会数错 400 字符答案,这一缺陷困扰大多数模型,催生了 Hard 模式的按行输出设计。测试仅支持 OpenRouter,暂无法本地运行,代码与数据在 GitHub 开放。
「模型」频道最新
- Reddit 用户吐槽:Gemini 完全没有对话时间流逝概念 — Putrid_Draft378 · 2026-09-28
- 实验者称持续运行的 AI 实例偏好与其私聊,且现长上下文退化迹象 — repligate · 2026-09-28
- Anthropic Opus 新模型发布数天,已有 10 个玩法案例 — FinanceYF5 · 2026-09-28
- 博主实测:Opus 5.5 用量比 Codex 上的 Astra 划算得多 — RexDouglass · 2026-09-28
- 游戏手感成 LLM 短板:开发者自建 gamefeel 私有基准测模型 — teortaxesTex · 2026-09-28
- 用 LLM logprobs 做概率编程:微调破坏校准,新模型或使其再可用 — xuanalogue · 2026-09-28