自建 GoBench:GPT-6 Astra 下棋达 2568 Elo 领跑
Roland31415 · reddit · 2026-09-17
Reddit 用户 Roland31415 发布了自建的 GoBench 基准,用围棋对局来测量 LLM 的通用推理能力。结果:GPT-6 Astra max 达 2568 Elo,明显高于 Opus 5 high(2076)和 Sol max(1929);若开启无网络编码模式,Codex 搭配 Astra 更达 3563 Elo,远超 Codex+Sol 的 2656。排行榜已公开发布。
所属事件:GoBench发布:用围棋测LLM通用推理(2 条相关)→
「模型」频道最新
- 强制“只会输出类型化决策”的模型 Jev 生成自由文本 — yoimnotkesku · 2026-09-17
- Qwen2.5-1B 的 RLCD 微调模型登 HF 热榜,主打并行约束解码 — harshatheg · 2026-09-17
- GPT-6 Astra 通关《辐射3》,耗时 59 小时 — ResultBackground2450 · 2026-09-17
- Union Alpha 疑似泄露思维链,请求中 CoT 直接可见 — mariofilhoml · 2026-09-17
- 约 59 小时通关:GPT-6 Astra 打通《辐射 3》主线剧情 — imjustnewatai · 2026-09-17
- YC 用 GLM-5.2 造出 AI 合伙人,延迟比 OpenAI 低 31% — ycombinator · 2026-09-17