Xeophon:知识类评测已死,编程基准也在走向消亡
xeophon · x · 2026-09-18
AI 评测圈知名观察者 Xeophon 指出,评测类目会整体消亡:随着模型能力提升,没人再用琐碎问答考模型,多选知识类基准早已失去意义。
他进一步表示,编程基准(coding benchmarks)也越来越让人有同样的感觉——作为评测工具的有效性正在衰减。
「模型」频道最新
- Databricks 自测称其 agent 追平 Claude 与 GPT-5.6 Luna,速度快一倍 — emmanuelvivier · 2026-09-18
- 开发者盘点 Jev 玩法:自驾驶、造语言、查数据库样样有 — iannuttall · 2026-09-18
- JEV 竞品模型将出,这类模型该叫什么? — altryne · 2026-09-18
- Armin Ronacher 设想:用 OpenAPI+RAG 取代 MCP? — mitsuhiko · 2026-09-18
- 网友预言:Opus 4.8 将像 GPT-4o 一样被开发者狂热追捧 — RileyRalmuto · 2026-09-18
- 实测:中国编码模型 token 消耗达 2-3 倍,便宜不等于省钱 — craigbalding · 2026-09-18