Grok 4.6 获 RuntimeWire 评测第一,击败 GPT-5.6 与 Claude
elonmusk · x · 2026-08-16
在 RuntimeWire 的 Newsroom Reliability v0.2 基准测试中,Grok 4.6 以 0.79 分排名第一,击败了 GPT-5.6 Sol、Claude Opus 4.8、Gemini 和 DeepSeek 等竞争对手。
「模型」频道最新
- 开发者吐槽 Claude:文档光写代码“不做”的事,让人哭笑不得 — chrisalbon · 2026-08-16
- Grok 思维链展示竟会采纳用户设定的角色语气 — Kyrannio · 2026-08-16
- Qwen3.8 vs 3.6写BASIC光线追踪:3.8自主迭代完成,3.6需人工干预 — Ok-Breakfast1878 · 2026-08-16
- Gemini 3.7 Flash实测:性价比高但限制多,编码一天仅用27%配额 — leebase65 · 2026-08-16
- Gemini 3.7 Flash 与 beacon.md 的实验记录 — sandoreclegane · 2026-08-16
- 测试称 Flash-0731 存在过拟合,DS 免费版获赞 — teortaxesTex · 2026-08-16