研究者直言部分 AA benchmark 有误导性,已失去信心

tianyin_xu · x · 2026-09-30

天一(音译)研究者公开表示,某些 AA(抽象/推理类)基准测试「误导性很强,以至于我已经失去了信心」。此言论是对同领域研究者讨论的回复,虽未展开具体细节,但反映了学界对现有 AI 推理评测基准质量的质疑情绪。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →