开发者质疑遥控驾驶基准计分:阶梯式提升实为误导

ben_j_todd · x · 2026-09-24

Ben Todd 转发了一条来自 Substack 的有价值的评论(原作者 Aman Karunakaran),指出某个遥控/驾驶类基准的「阶梯式能力跃升」图表具有误导性。

该基准的计分方式是给模型 3 次尝试机会,看它能沿赛道(锥桶围成)走多远才偏出。但赛道难度并非递增,实际只有少数几个「卡点」:一旦模型闯过某个卡点,通常能顺利前进到下一个卡点。评论者以 Fable(橙色)与 Astra(紫色)的对比为例,指出 Fable 的第三次尝试与 Astra 的第一次尝试表现基本相同;视频里部分锥桶在赛道后段较稀疏、更难看清,且赛道起点就是一个急转弯,多数模型(包括 Fable 的前两次尝试)都会在此失败。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →