Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分
marktenenholtz · x · 2026-10-07
Mark Tenenholtz 提出:大多数超过 2-3 个月仍未饱和的基准,之所以还有提升空间,是因为任务本身写得糟糕、评分实现得很差,或两者兼有——而非模型能力真有差距。这是对当前 AI 榜单可信度的直接质疑。
「模型」频道最新
- Reddit 用户吐槽 ChatGPT 频繁误判违规:"对不起,戴夫"式拒绝越来越多 — Crixusgannicus · 2026-10-07
- Runware API 上线两款内容审核模型,政策用自然语言描述即可 — aziz4ai · 2026-10-07
- Ethan Mollick 提醒 AI 实验室:先确保自家模型会用自家产品 — emollick · 2026-10-07
- OpenAI 推出 Decisions API 公测:比 GPT-6 Luna 快 10 倍替应用做决策 — OpenAIDevs · 2026-10-07
- Cloudflare 开源视觉决策模型 clef,速度惊艳引热议 — michellechen · 2026-10-07
- 团队实测 OpenAI Decisions API:网页质量过滤 AUPRC 达 88.8% — OpenAIDevs · 2026-10-07