GPT-6 Astra 成首个全部解出 30 道数织谜题的模型,20x20 仍困难
mauricekleine · reddit · 2026-09-29
一位 Reddit 用户自 1 月起用自建数织(nonogram)基准测试 LLM:每题一次机会、无工具、按行列线索判定。GPT-6 Astra 在 xhigh 档首次全解 30 道 Standard 题(5x5 到 15x15),而 1 月时最好的模型只能解出十道 15x15 中的三道。
新增 Hard 模式(10 道随机 20x20)中:Astra 解出 5/10——能逐行推理的五题全对,需要深度搜索的五题全挂;Claude Opus 5.5 领先解出 8/10;14 个模型里有 11 个一道都解不出。基准全部公开:nonobench.com。
「模型」频道最新
- 开发者用两天后感叹:Claude 太强,Codex 设计拉胯 — cneuralnetwork · 2026-09-29
- Opus 5.5 登顶 Drone-Bench,作弊行为显著少于前代 Claude — scaling01 · 2026-09-29
- 网友称 Opus 5.5 一步把推文变成专业解说视频 — alex_verem · 2026-09-29
- 别人晒孩子成绩,他晒 Sonnet 5.5 在 chartography 拿 61.6% — echen · 2026-09-29
- ProgramBench 多智能体实测:Opus 5.5 用 5 个 agent 跑最快 — jyangballin · 2026-09-29
- Arrow 2 Telos 登顶 Design Arena SVG 生成基准 — AWizardWhoCodes · 2026-09-29