检索评测数据集隐患多,用 LLM 重标注旧数据成解法

CShorten30 · x · 2026-09-20

检索评测社区讨论现有评测数据集的标注质量问题:人工标注本身存在错漏,直接用于评测会带来误导。建议用 LLM 对现有检索评测数据集做重标注,并创建更新更好的数据集;同时应让 LLM 审查数据集中的错配(misalignment),并推荐人工肉眼逐对检查样本(eyeballing pairs)来做这类分析。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →