Xeophon:知识类评测已死,编程基准也在走向消亡

xeophon · x · 2026-09-18

AI 评测圈知名观察者 Xeophon 指出,评测类目会整体消亡:随着模型能力提升,没人再用琐碎问答考模型,多选知识类基准早已失去意义。

他进一步表示,编程基准(coding benchmarks)也越来越让人有同样的感觉——作为评测工具的有效性正在衰减。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →