基准分数可能越来越不能代表真实生产力

Minimum-Bonus-1365 · reddit · 2026-07-22

这条帖子认为,榜单/基准的胜利已经不能很好代表真实世界中的 AI 表现。

它引用 METR 的研究结论:前沿模型即使在标准评测上表现很好,在长周期、真实的软件工程任务中仍然会明显吃力。核心质疑是,行业是否正在把优化目标从“有用”悄悄变成“刷分”。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →