两个标注员都对不上?先修评分标准,别怪模型
blaizedsouza · x · 2026-09-13
开发者分享一套「标注员一致性检查」流程,核心观点:如果两个受过训练的人都无法就同一条数据达成一致,问题出在评分标准(rubric),而不是模型;噪声标签集会让所有模型表现看起来像随机的。
操作清单:
- 对一部分样本做双重标注
- 按 rubric 条目分别计算一致率
- 分歧样本交给仲裁人
- 重写一致率低的条目
- 让标注员按新表述重新培训
- 不发布建立在噪声上的分数
要点: 安全类条目需要比语气类条目更高的一致性标准。发帖前先自问:你的流程里两个标注员看到的是同一个案例吗?
「编程与Agent」频道最新
- Teknium 排障 AI 交易 agent:审批门 60 秒超时拖垮整个流程 — Teknium · 2026-09-13
- Teknium 排查 trading agent:60 秒审批超时拖垮整个流程 — Teknium · 2026-09-13
- DocWriter 用多智能体流水线提取用户写作风格,而非硬塞上下文 — sh_reya · 2026-09-13
- ESP32 桌面 AI 伴侣开源:Copilot CLI 全程搞定固件、精灵图与烧录 — DanWahlin · 2026-09-13
- macOS上agent电脑操作工具怎么选:OpenAI官方推荐Playwright+PyAutoGUI — sdand · 2026-09-13
- 从产品经理转型工程岗:不写代码也能算'技术人' — brandon_galang · 2026-09-13