绕锥评测成绩被质疑误导:三段式计分与难度递增假设存疑
ben_j_todd · x · 2026-09-24
Ben Todd 转发一条 Substack 评论,质疑某模型绕锥(cone course)评测成绩「阶跃式提升」的说法:
- 评分机制是给模型 3 次尝试,看它能沿锥桶赛道走多远出界;但赛道难度并非递增,实际只有少数几个「卡点」(chokepoint),过了卡点模型通常能一路推进到下一个。
- 对比 Fable(橙)与 Astra(紫)的轨迹可见,Fable 第三次尝试与 Astra 第一次尝试几乎相同;部分锥桶难看清或稀疏,赛道开头还有一个大多数模型都过不去的急弯,Fable 前两次尝试也栽在这。
- Ben Todd 补充:目前成绩并不算好,但照此进步速度,一年内或许能变好。
所属事件:Gemini Astra 疑似未经训练突现驾驶能力引热议(4 条相关)→
「模型」频道最新
- ChatGPT 语音接入插件并由 GPT-6 驱动,可语音操作办公全流程 — Dimillian · 2026-09-24
- 爆料讨论:某前沿模型比 Astra 领先 8 个月、仅超前趋势 2 个月 — scaling01 · 2026-09-24
- Navier-Stokes 证明耗 1300 亿输出 token,OpenAI 重度用户日均仅数十亿 — scaling01 · 2026-09-24
- Meta Muse 4 万评分达 4.88:产品、分发、价格三线碾压式竞争 — RihardJarc · 2026-09-24
- 重跑 Audi 3D 建模对比:只有 GPT-6 Astra 与 Opus 5.5 能打 — kevinkern · 2026-09-24
- 自建 200 题校准测试:模型自报 90% 把关可信度 — colinmcnamara · 2026-09-24