基准已死?评测者称 AI 下一步要测判断力与恢复能力

Div_pradeep · x · 2026-09-04

有观点指出,AI 评测界多年来只优化"答案正确率",因为它是可量化的;但随着所谓 GPT-6 Astra 发布、OpenAI 宣称进入 AGI 时代,模型在计算机操作、编程、研究等长任务上的表现越来越难用传统 benchmark 打分。下一阶段的评测可能需要衡量模型的判断力(judgment)、出错后的恢复能力(recovery)和实际运营中的可用性(operational usefulness)——即"无法打分的 AI"时代。

所属事件:AI 评测转向:能力型基准已死,环境与判断力成新焦点(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →