tokenbender:前沿模型基准全失真,能力越强盲点越不似人类

tokenbender · x · 2026-09-18

tokenbender(01.AI 前 AI 负责人)表示,如今已很难依赖任何基准来衡量前沿模型的 SWE/机器学习能力。这些模型潜力巨大,却同时存在极其「不似人类」的盲点,令他与当前榜单所测出的东西产生强烈割裂感。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →