开发者吐槽:别信 benchmark,实测代码审查 Kimi 表现更好
JensHonack · x · 2026-07-18
有开发者反馈,在代码审查等实际应用场景中,不能盲信官方的基准测试成绩:某款被评为“高”分的模型实际表现反不如另一款“低”分模型。
推文借此调侃,期待即将发布的 Kimi 3 也能经受住“别信 benchmark”的实测检验。
「编程与Agent」频道最新
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11