两个标注员都对不上?先修评分标准,别怪模型

blaizedsouza · x · 2026-09-13

开发者分享一套「标注员一致性检查」流程,核心观点:如果两个受过训练的人都无法就同一条数据达成一致,问题出在评分标准(rubric),而不是模型;噪声标签集会让所有模型表现看起来像随机的。

操作清单:

要点: 安全类条目需要比语气类条目更高的一致性标准。发帖前先自问:你的流程里两个标注员看到的是同一个案例吗?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →