只读前 50 条就漏掉 75% 少数证据:AI 验证器省成本实测
iMiguelmars · reddit · 2026-09-15
作者团队分享了一个 AI 验证管线的实测教训:成本瓶颈已从检索转移到「系统需要读多少证据才敢说没漏」。几种看似直观的省读法都被证明不可靠:
- 提前停止:在冻结回放用例中,要保证全召回,需要在 407–454 的候选池里读到约 290–426 条,远超预期深度。
- 少数派证据:那些只有 8 个独立读取器中 1 个注意到的关键证据,在 k=50 时最多只有 2/8 存活——早期截断会系统性丢掉长尾。
- 按规则跳过「看起来没用」的切片:某版本跳过了 17 个事后证明含相关证据的切片,不能当作安全过滤器。
- 去重收益很小:删除字节级完全重复的文本只减少约 3.3% 的切片量,且不减少读取会话数。
作者总结当前的核心权衡:读得更少、保住高召回、不系统性丢掉少数派/怪异证据,且不能把「没检查」悄悄变成「没东西」。提问社区:学习型路由、更好的停止准则、多阶段审查,以及如何证明「决定不读的部分确实安全可跳」。
所属事件:实测:AI验证器只读前50条证据漏掉75%少数证据(2 条相关)→
「研究」频道最新
- AI Beyond Scaling 播客上线,BOLD Fellows 首批申请今日英国时间中午截止 — j_foerst · 2026-09-15
- 微软提出 ESRL:锚定高置信专家提升 MoE 强化学习探索 — MicrosoftResearch · 2026-09-15
- Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache — Vishesh Tripathi · 2026-09-15
- Amazon MInTRL:稀疏离策略干预提升在线策略 RL 探索 — amazon · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15
- Phillip Isola 团队另辟蹊径:超快模拟器让 RL 从零起跑 — AjdDavison · 2026-09-15