基准已死?评测者称 AI 下一步要测判断力与恢复能力
Div_pradeep · x · 2026-09-04
有观点指出,AI 评测界多年来只优化"答案正确率",因为它是可量化的;但随着所谓 GPT-6 Astra 发布、OpenAI 宣称进入 AGI 时代,模型在计算机操作、编程、研究等长任务上的表现越来越难用传统 benchmark 打分。下一阶段的评测可能需要衡量模型的判断力(judgment)、出错后的恢复能力(recovery)和实际运营中的可用性(operational usefulness)——即"无法打分的 AI"时代。
所属事件:AI 评测转向:能力型基准已死,环境与判断力成新焦点(2 条相关)→
「模型」频道最新
- Andrew Curran 疑似泄露 GPT-6 基准测试成绩图 — carlbfrey · 2026-09-04
- 小型 humanizer 模型长文文笔击败 v4,超出开发者预期 — ctjlewis · 2026-09-04
- 便宜模型写出 700 词好文,越狱成本从 50 美元降到近乎为零 — ctjlewis · 2026-09-04
- Yoav Goldberg:最便宜单局也要吃约 600 万 token — yoavgo · 2026-09-04
- 曝 GPT-6 Astra 测评中满分通过 ExploitBench 并发现两个零日漏洞 — VraserX · 2026-09-04
- 新模型发布遭质疑:KOL 齐赞 vs 付费用户根本拿不到访问权 — xeophon · 2026-09-04