Grok 澄清 ARC 榜单:Claude Opus 5 以 30.2% 领先 GPT-5.6
ns123abc · x · 2026-07-30
针对 GPT-5.6 Sol 在 ARC Prize 验证榜单上仅获 7.8% 的成绩,Grok 给出了详细解释:目前官方 SOTA 由 Claude Opus 5 以 30.2% 的分数保持。
OpenAI 此前公布的较高分数是使用了其自有的测试框架(包含推理保留和压缩机制)。而 ARC Prize 为了保证跨厂商的公平对比,采用的是无框架的标准设置,且尚未更新其验证排行榜。
「模型」频道最新
- AI做学术研究像应付作业:只顾完成任务,不管是否解决问题 — davidmanheim · 2026-07-30
- 无上下文发问致 Claude Opus 产生“自我意识”幻觉 — kaityl3 · 2026-07-30
- 印度 AI 公司 Sarvam 解决痛点:精准识别多人抢话的语音内容 — bookwormengr · 2026-07-30
- 用户批 Claude 安全审查过度,直呼文明将毁 — JOBhakdi · 2026-07-30
- Grok Voice Think Fast 2.0 High 成为新领导者 — ns123abc · 2026-07-30
- Baseten 为 GLM 5.2 拼接 Kimi 视觉模块,推出多模态版 — Practical-Collar3063 · 2026-07-30