前沿AI评测缺失人类基准,人机协同评估成新焦点

随着AI基准测试日益复杂,沃顿商学院教授Ethan Mollick指出前沿AI评测正丧失与人类能力的对比这一核心环节,缺乏人类基线数据成为致命隐患。同时,业界呼吁应为人机组合建立独立评测标准,因为单独衡量模型性能会忽略AI辅助下人类真正能完成什么。斯坦福等机构也提出了CollabSkill框架,以重新评估真实职业任务中的人机协作能力。

2026-07-29 ~ 2026-07-31 · 4 条相关