新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天
windx0303 · x · 2026-09-26
康奈尔团队(Zeyu He、Ting-Hao Huang 等)在 arXiv 发布论文,提出用 LLM 间分歧来定位需要专家介入的案例,加速大规模文本标注的码本(codebook)修订。
方法
- 用早期码本让 LLM 预标注数据,找出多模型分歧强烈的样本,引导专家反馈。
- 比较三种专家反馈方式:① 编辑 LLM 生成的码本修订(Verifying);② 回答 LLM 关于分歧的提问(Question Answering);③ 对分歧案例做带理由的标注(Rationale Labeling)。
结果(数千份辅导对话转录上验证)
- Rationale Labeling 效果最佳,LLM 标注准确率达 64.9%,超过专家直接修订的码本(57.8%)。
- 最优 Question Answering 设置也达 60.5%,高于专家码本。
结论:LLM 可用来战略性分配专家注意力,把原本需数月的码本修订缩短到几天,且不牺牲标注质量。
「研究」频道最新
- 新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙 — jankulveit · 2026-09-26
- 三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大 — suchenzang · 2026-09-26
- 合成数据的重点正在转移:后训练里模拟将比蒸馏更重要 — realsohamparekh · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26
- Lawrence Krauss 播客探讨 AI 如何放大论文工厂的危害 — willcb · 2026-09-26
- 免微调让本地模型即时纠错:4096 原型池方案开源,NumPy+Java 实现 — thisdudelikesAI · 2026-09-26