研究者承认大模型评测框架与打分机制存在严重缺陷

scaling01 · x · 2026-07-30

AI 研究者发文承认,此前外界对大模型评测打分机制和测试框架的批评是正确的。这反映了当前 LLM 评测体系在可靠性与公平性上确实存在普遍痛点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →