Nonobench:49 个 LLM 玩数独画谜,15×15 通过率仅 20%

mauricekleine · reddit · 2026-10-04

Nonobench 是一个开源基准,测试 LLM 解 nonogram(画谜/数织)谜题的能力:模型只看一次行列线索就要输出完整网格,不许用工具,每题只许尝试一次。

方法:标准模式为 30 道 5×5 到 15×15 的谜题(来自 Moyà-Alcover 的 Nonograms 数据集,CC BY 4.0);困难模式为 10 道 20×20 随机谜题(保证唯一解,其中 5 道无法仅靠行逻辑解出);跨推理力度共 130 个变体,经 OpenRouter 或各厂商官方端点运行。

结果:以各模型最佳推理力度计,解题率从 5×5 的 85% 跌到 10×10 的 46%、15×15 的 20%。GPT-6 Astra 解出标准模式全部 30 题;困难模式下 Claude Opus 5.5 解出 10 题中的 8 题,15 个模型一题未解。有趣的是:若要求把答案写成单个 400 字符字符串,多数模型在逻辑变难之前就数错了,所以困难模式改为输出 20 行字符串数组。

局限:每题仅一次尝试,单次结果噪声大(已给出 95% 置信区间)。网站 nonobench.com,代码 MIT 开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →