43 个 LLM 拼数独类谜题:GPT-6 Astra 首个满分,开源模型 Hard 模式全军覆没

mauricekleine · reddit · 2026-09-27

作者发布 Nonobench v1.2,用 nonogram 逻辑谜题测试 43 个 LLM,prompt 与全部输出公开。

主要结果:

此前社区发现 Grok 会数错 400 字符答案,这一缺陷困扰大多数模型,催生了 Hard 模式的按行输出设计。测试仅支持 OpenRouter,暂无法本地运行,代码与数据在 GitHub 开放。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →