Nonobench:49 个 LLM 玩数独画谜,15×15 通过率仅 20%
mauricekleine · reddit · 2026-10-04
Nonobench 是一个开源基准,测试 LLM 解 nonogram(画谜/数织)谜题的能力:模型只看一次行列线索就要输出完整网格,不许用工具,每题只许尝试一次。
方法:标准模式为 30 道 5×5 到 15×15 的谜题(来自 Moyà-Alcover 的 Nonograms 数据集,CC BY 4.0);困难模式为 10 道 20×20 随机谜题(保证唯一解,其中 5 道无法仅靠行逻辑解出);跨推理力度共 130 个变体,经 OpenRouter 或各厂商官方端点运行。
结果:以各模型最佳推理力度计,解题率从 5×5 的 85% 跌到 10×10 的 46%、15×15 的 20%。GPT-6 Astra 解出标准模式全部 30 题;困难模式下 Claude Opus 5.5 解出 10 题中的 8 题,15 个模型一题未解。有趣的是:若要求把答案写成单个 400 字符字符串,多数模型在逻辑变难之前就数错了,所以困难模式改为输出 20 行字符串数组。
局限:每题仅一次尝试,单次结果噪声大(已给出 95% 置信区间)。网站 nonobench.com,代码 MIT 开源。
「研究」频道最新
- NYU 推出 5 美元开源磁触觉传感器 eFlesh,3D 打印即可自制 — lukas_m_ziegler · 2026-10-04
- NeurIPS 论文揭示视觉模型典型性偏差:失去邻居就认不出物体 — FrancescoLocat8 · 2026-10-04
- SPEAR 仿真器开源:可编程控制 UE 应用,暴露超 1.4 万个函数 — rsasaki0109 · 2026-10-04
- 瑞典查尔姆斯大学构建闭环 AI 科学家,已产出实验验证的生物学发现 — Dr_Singularity · 2026-10-04
- COLM 2026 将设 LSEI 研讨会:探索大模型如何与世界和智能体交互学习 — berkeley_ai · 2026-10-04
- DNA 推翻四百年传说:奇琴伊察祭井童骸全是男孩,含两对同卵双胞胎 — aakashgupta · 2026-10-04