antirez:编码评测基准多是「垃圾」,与训练实际能力严重脱节

antirez · x · 2026-09-03

Redis 作者 antirez 发推指出,模型在训练过程中取得的进展,与后来用于评测的基准关系很小;他判断每家大型 AI 实验室都有一套私有的内部基准,用于真正衡量模型是否变强。

他建议去打开各大实验室使用的顶级编码评测基准亲自看看:「大多是垃圾」,主要在考验工具调用,以及 C++、Python 等语言之间的摩擦,而非真实世界中的模型行为。

所属事件:antirez 炮轰编码评测基准质量低劣(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →