BrowseComp 图表显示 Kimi K3 高分低成本,排在左上角
iamfakhrealam · x · 2026-07-23
配图是一张 BrowseComp 得分 vs 单任务成本 的对比图。
图中能看到的几个点包括:
- Kimi K3 (max) 位于左上角附近,低成本下得分很高
- GPT-5.6 Sol 和几款 Claude 模型分布在更高成本的区间
- Claude Mythos 5 (max) 在较高成本下进入图表上半区
- Claude Opus 4.8 与 Claude Sonnet 5 的得分整体低于最顶尖点
这条帖子的重点是 性价比/评测对比,而不是单纯的新产品发布。
「模型」频道最新
- Qwen-Image-3.0 对上 GPT-Image-2 做复杂版式实测 — Scobleizer · 2026-07-23
- Dean Ball 认为 Kimi 编码很强,但开权重经济账仍吃亏 — koltregaskes · 2026-07-23
- Simon Willison:模型已能原生完成长任务,loops 正变得过时 — teropa · 2026-07-23
- 一个 Qwen 3.6 27B 衍生模型声称推理 token 减少 90% 以上 — AppealSame4367 · 2026-07-23
- Claude Opus 5 传闻、OpenAI Codex 语音 agent 与 Cerebras 750 tok/s — imjustnewatai · 2026-07-23
- Grok Build 据称在浏览器任务上胜过 Codex 和 Claude Code — elonmusk · 2026-07-23