纯文本推理攻克魔方:GPT-5.6 Sol 333 步解开打乱 3×3,CubeBench 0% 已被打破

Willing_Plate_5417 · reddit · 2026-09-12

CubeBench 此前报告主流 LLM 在其长程魔方任务上通过率为 0.00%,该 benchmark 专门测试空间推理、长程状态追踪和对变化物理系统的内部建模。Reddit 用户 WillingPlate5417 用前沿模型重新挑战了这个问题。

他给 GPT-5.6 Sol 一个打乱的 3×3 魔方原始面贴状态,只允许通过文本与魔方引擎交互——禁用 Python、外部求解器、隐藏答案和程序化状态模拟器。结果:模型成功复原,用时 750.5 秒、333 步、61 轮交互、0 次非法移动。过程并不优雅:选择低效、需要自我纠错、途中能识别 OLL/PLL 情形,步数远超人类速拧选手。

作者的核心结论:这不是推翻 CubeBench,而是证明此类 benchmark 的价值在于给能力前沿打上时间戳——「0% 成功率」衡量的是一代模型,而非架构的永久边界,这类「从根本限制变成已证能力」的翻转未来几年会频繁出现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →