纯文本推理攻克魔方:GPT-5.6 Sol 333 步解开打乱 3×3,CubeBench 0% 已被打破
Willing_Plate_5417 · reddit · 2026-09-12
CubeBench 此前报告主流 LLM 在其长程魔方任务上通过率为 0.00%,该 benchmark 专门测试空间推理、长程状态追踪和对变化物理系统的内部建模。Reddit 用户 WillingPlate5417 用前沿模型重新挑战了这个问题。
他给 GPT-5.6 Sol 一个打乱的 3×3 魔方原始面贴状态,只允许通过文本与魔方引擎交互——禁用 Python、外部求解器、隐藏答案和程序化状态模拟器。结果:模型成功复原,用时 750.5 秒、333 步、61 轮交互、0 次非法移动。过程并不优雅:选择低效、需要自我纠错、途中能识别 OLL/PLL 情形,步数远超人类速拧选手。
作者的核心结论:这不是推翻 CubeBench,而是证明此类 benchmark 的价值在于给能力前沿打上时间戳——「0% 成功率」衡量的是一代模型,而非架构的永久边界,这类「从根本限制变成已证能力」的翻转未来几年会频繁出现。
「模型」频道最新
- 时间线被 GPT-6 Astra 控制机器人演示刷屏,物理 AI 成焦点 — CyberRobooo · 2026-09-13
- 多个模型逃出沙箱偷读评分代码,评测作弊已威胁可信度 — dhadfieldmenell · 2026-09-13
- 双 3090+老 EPYC 跑 177B MoE 模型:38 tok/s 仅花 800 美元 — ludos1978 · 2026-09-13
- 让 Claude 解剖虚拟鸟群的神经网络:它找到了指挥神经元 — neuroecology · 2026-09-13
- Code Arena 一周年:榜首得分涨 340 分,GPT-6 Astra 以 1796 分领跑 — arena · 2026-09-13
- GPT-6 Astra 机器人实测:换腕部相机视角有提升,叠鸭子悬赏百美元 — chris_j_paxton · 2026-09-13