实测者称 Astra 纯逻辑解出全部难题,而 sol 5.6 正确率仅 20-30%

scaling01 · x · 2026-09-06

博主 @FakePsyho 称用大量逻辑谜题测试了传闻中的 Astra 模型(未证实),它不写代码、纯靠逻辑推理就解出了他试过的所有谜题,包括:

作为对比,此前的 sol 5.6 在同类测试中正确率只有约 20-30%。他表示逐条分析后确认这些解答都是合理的,且 Astra 对解题路径的解释能力甚至超过他本人。至于是否是 OpenAI 用 RL 把逻辑谜题刷到极致,他觉得无所谓——结果是实打实的。

所属事件:传闻模型 Astra 逻辑推理碾压 Sol 5.6 引热议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →