自建评测跑 10 个模型,Fable 5 与 Opus 4.6 领跑
rudrank · x · 2026-07-24
- 作者主张,每个人都应该根据自己的需求设计评测,并用同一套 harness 在相同条件下对比模型更新。
- 这次他们跑了一个 “article taste” 评测,覆盖 10 个模型。
- 图里显示,Fable 5 和 Opus 4.6 排在前两位,Kimi K3 紧随其后。
- 作者的结论是:搭建这套评测很费劲,但一旦跑起来,迭代过程会非常有趣。
「模型」频道最新
- 智谱展示 GLM 5.2 上线 Agent Platform,8 张 H200 月成本约 8.4 万美元 — dejanseo · 2026-07-24
- 开发者盛赞 OpenAI 新模型:GPT-5.6 表现出色,Sol 令人惊艳 — brianmichel · 2026-07-24
- 有人称 GPT-4.5 是最好用的 AI 写作模型,呼吁恢复 — niloofar_mire · 2026-07-24
- OpenAI 和 Anthropic 的实时语音模型或很吃超低延迟推理 — downingARK · 2026-07-24
- Claude Opus 5 疑似以“4.8”名义向部分用户灰度 — legit_api · 2026-07-24
- OpenAI 安全框架被用来质疑其模型是否已越过网攻门槛 — ronbodkin · 2026-07-24