SimpleBench 结果:Kimi-K3 表现诡异,Grok 4.6 领跑
scaling01 · x · 2026-08-16
SimpleBench 评测结果显示,Kimi-K3 和 Qwen3.8 2.4T 的表现非常奇怪,而 Grok 4.6 和 Muse Spark 1.2 则表现出色。
「模型」频道最新
- 开发者吐槽 Claude:文档光写代码“不做”的事,让人哭笑不得 — chrisalbon · 2026-08-16
- Grok 思维链展示竟会采纳用户设定的角色语气 — Kyrannio · 2026-08-16
- Qwen3.8 vs 3.6写BASIC光线追踪:3.8自主迭代完成,3.6需人工干预 — Ok-Breakfast1878 · 2026-08-16
- Gemini 3.7 Flash实测:性价比高但限制多,编码一天仅用27%配额 — leebase65 · 2026-08-16
- Gemini 3.7 Flash 与 beacon.md 的实验记录 — sandoreclegane · 2026-08-16
- 测试称 Flash-0731 存在过拟合,DS 免费版获赞 — teortaxesTex · 2026-08-16