如何信任 AI 研发评测?关键看打分者有没有亲手标过数据

dfrsrchtwts · x · 2026-09-23

作者提出一个「全盘考虑后的」观点:只有当 AI 研发类评测(evals)由亲手做过大量模型输出人工打分、并认真思考过如何把这种经验转化为评测的人来制作和评分时,他才信任这些评测。

同时他指出,游戏类 bot 任务并不属于人们通常所说的「AI R&D evals」,即评测任务的设计应区分能力域,不能一概而论。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →