前沿AI评测失真:缺乏人类基线数据成致命隐患

emollick · x · 2026-07-30

Ethan Mollick 指出,随着测试前沿 AI 模型的基准测试变得越来越复杂,评测体系正在丧失一个最核心的环节:与人类能力的对比。

他认为,经过验证的基准测试必须包含人类(最好是多个人类)的基线数据。尽管在复杂任务上获取人类基线正变得日益困难且昂贵,但这对于准确衡量 AI 的真实能力水平至关重要。

所属事件:斯坦福提出 CollabSkill 框架重新评估人机协同(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →