博主指出:多份基准测试的多数错误源自评测本身而非模型

zainhas · x · 2026-09-16

博主 zainhas 评论一份分析,称大量基准测试中出现的「模型错误」其实多数是基准题本身或评分器的错误,而非模型能力问题——「错误来自评测房子内部」。这呼应了社区对 LLM 评测可信度、grader 噪声的持续质疑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →