dlwh:几乎所有评测都坏了,靠盲爬坡却做出了惊人进展

dlwh · x · 2026-09-10

AI 研究者 dlwh 提出一个反直觉观点:AI 领域第二项「不合理地有效」的事情,是在几乎所有评测基准都存在严重缺陷的情况下,对它们进行盲目爬山式优化竟然仍然带来了惊人的进步。这句话点出了 eval 质量与实际能力进步之间的悖论关系。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →