Grok 4.6 获 RuntimeWire 评测第一,击败 GPT-5.6 与 Claude
elonmusk · x · 2026-08-16
在 RuntimeWire 的 Newsroom Reliability v0.2 基准测试中,Grok 4.6 以 0.79 分排名第一,击败了 GPT-5.6 Sol、Claude Opus 4.8、Gemini 和 DeepSeek 等竞争对手。
「模型」频道最新
- Looped Transformers 成研究新热,Kye Gomez 称早被自己押中 — KyeGomezB · 2026-10-02
- 每月 400 美元买哪个 Agent?网友提议让它们同城对抗实测 — nick_linck · 2026-10-02
- fastino 发布 GLiDE:首个按需思考的决策模型,Decision Index 登顶 — kalyan_kpl · 2026-10-02
- Anthropic 自述:从 Sonnet 5 的「难聊」到 Fable 5.1 找回经典 Claude 手感 — every · 2026-10-02
- 1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼 — michellechen · 2026-10-02
- 两张 96GB 昇腾卡本地跑 Qwen:从 1 tok/s 调到 30 tok/s 全记录 — matteiuspi · 2026-10-02