AI 编码评测暗箱操作?闭源模型被指刻意隐瞒成绩

astralmatrix · x · 2026-08-13

近期 AI 编码模型的评测榜单引发争议。有开发者指出,某家与 CursorBench 评测平台关系密切的公司,其模型在自家生态的评测中表现极佳(达到 fable 级别),但在第三方独立测试集 DeepSWE 上却表现糟糕。

这引发了行业对评测公正性的质疑:究竟是两个测试集侧重点不同,还是存在利益相关的暗箱操作?更有评论者尖锐指出,如果编码评测基准不公开透明,整个跑分体系就失去了意义,呼吁厂商向世界公开真实的评测细节。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →