开发者质疑遥控驾驶基准计分:阶梯式提升实为误导
ben_j_todd · x · 2026-09-24
Ben Todd 转发了一条来自 Substack 的有价值的评论(原作者 Aman Karunakaran),指出某个遥控/驾驶类基准的「阶梯式能力跃升」图表具有误导性。
该基准的计分方式是给模型 3 次尝试机会,看它能沿赛道(锥桶围成)走多远才偏出。但赛道难度并非递增,实际只有少数几个「卡点」:一旦模型闯过某个卡点,通常能顺利前进到下一个卡点。评论者以 Fable(橙色)与 Astra(紫色)的对比为例,指出 Fable 的第三次尝试与 Astra 的第一次尝试表现基本相同;视频里部分锥桶在赛道后段较稀疏、更难看清,且赛道起点就是一个急转弯,多数模型(包括 Fable 的前两次尝试)都会在此失败。
「模型」频道最新
- GPT-6 系列能力不及 GPT-5.6,首次出现代际升级反而变弱 — srchvrs · 2026-09-24
- OpenAI 发布 GPT-6 Sol 与 Luna:API 定价较 GPT-5.6 降 50% — DeryaTR_ · 2026-09-24
- NVIDIA 开源 Nemotron 3 说话人分离模型,登顶 VoiceArena 榜单 — solyarisoftware · 2026-09-24
- 用户实测:Opus 5.5 做金融建模比 Fable 慢 10 倍 — JOBhakdi · 2026-09-24
- OpenAI 升级 ChatGPT 语音:可调用邮箱日历 Slack 并驱动 GPT-6 — Dimillian · 2026-09-24
- Code Arena 推出 WebDev 排行榜,可在线体验对比 — arena · 2026-09-24