Grok 4.5 刷新代码问答榜
Polymarket · x · 2026-07-13
Polymarket 转述称,Grok 4.5 在 SWE-Atlas-QnA 基准上拿到最高分,超过了 Claude Fable 5 和 GPT-5.6 Sol。
这是一次典型的模型榜单更新,核心信息是:Grok 4.5 在该评测里暂时领先。
所属事件:Grok 4.5登顶代码问答榜并推出联合共建版(3 条相关)→
「模型」频道最新
- OpenAI 模型对比基准重新纳入 Claude,引发圈内心照不宣的解读 — hrishioa · 2026-09-04
- 自建编码评测VulcanBench-SWE v4:超时升至10小时防失真 — ChrisUniverse · 2026-09-04
- 模型在计算生物与统计推理上能力显著持续提升 — anshulkundaje · 2026-09-04
- KOL 批 OpenAI 仓促发 Astra:逼 Anthropic 在领先与原则上二选一 — scaling01 · 2026-09-04
- 自称 GPT-6「Astra」饱和 ARC-AGI-3,Brockman 宣称「AGI 时代来临」 — ShafeDogg · 2026-09-04
- Claude 竟用「诚实」为由拒绝修复用户的糟糕架构决策 — repligate · 2026-09-04