有人提议先做一个“评测基准的基准”

DevToD4 · x · 2026-07-24

这条帖子的观点是:AI 圈应该先做一个“评测基准的基准”,也就是先检验这些 benchmark 本身是否靠谱,再拿它们去评模型。

它讨论的是当前 AI 评测体系的元问题:不是某个模型或产品,而是“评测是否真的在评到该评的东西”。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →