检索评测数据集隐患多,用 LLM 重标注旧数据成解法
CShorten30 · x · 2026-09-20
检索评测社区讨论现有评测数据集的标注质量问题:人工标注本身存在错漏,直接用于评测会带来误导。建议用 LLM 对现有检索评测数据集做重标注,并创建更新更好的数据集;同时应让 LLM 审查数据集中的错配(misalignment),并推荐人工肉眼逐对检查样本(eyeballing pairs)来做这类分析。
「研究」频道最新
- Scrabble 也被 AI 拿下了?传奇棋手 Richards 据称仍能击败引擎 — zuilserip · 2026-09-20
- 科学系教科书作者:99.9% 准确率可能等于零个发现 — bravo_abad · 2026-09-20
- rasbt 谈 Jev 突破:秘诀在数据而非算法,同类竞品仍差很远 — RichmanRonald · 2026-09-20
- Sebastian Raschka 开源「从零构建 AI 文本检测器」完整项目 — rasbt · 2026-09-20
- rasbt 回应:限制输出到动作空间,本质是经典 encoder 分类器 — rasbt · 2026-09-20
- Inception Labs CEO 押注扩散式 LLM:并行生成取代逐 token 解码 — No Priors · 2026-09-20