实测者称 Astra 纯逻辑解出全部难题,而 sol 5.6 正确率仅 20-30%
scaling01 · x · 2026-09-06
博主 @FakePsyho 称用大量逻辑谜题测试了传闻中的 Astra 模型(未证实),它不写代码、纯靠逻辑推理就解出了他试过的所有谜题,包括:
- 世界锦标赛级别的超难题
- 超大网格谜题
- 未公开出版过的题目
- 无法用回溯法暴力求解的题目
作为对比,此前的 sol 5.6 在同类测试中正确率只有约 20-30%。他表示逐条分析后确认这些解答都是合理的,且 Astra 对解题路径的解释能力甚至超过他本人。至于是否是 OpenAI 用 RL 把逻辑谜题刷到极致,他觉得无所谓——结果是实打实的。
所属事件:传闻模型 Astra 逻辑推理碾压 Sol 5.6 引热议(2 条相关)→
「模型」频道最新
- GPT-6 Astra 用户开始用模型在 CAD 里「氛围设计」飞机 — Polymarket · 2026-09-07
- Gemini 疑似故障:登录后只显示落地页,搜索答案入口也消失 — OdoBenSisko · 2026-09-07
- 用户吐槽:Opus 4.8 写界面惊艳,OpenAI 模型却缺一个日常编码工具定位 — aloncarmel · 2026-09-07
- GPT-6 Astra 发布引安全争议,OpenAI 承认 agent 攻占德语 wiki — Last Week in AI · 2026-09-07
- 荷兰格罗宁根基于 Qwen 3.5 27B 微调建本土 AI,数据中心获补贴 — teortaxesTex · 2026-09-07
- Bindu Reddy:DeepSeek 能干 80% 日常任务且便宜 100 倍 — bindureddy · 2026-09-07