语义缓存自我污染:缓存正常工作竟让 2% 错误率保证失效超 3 倍
Reasonable_Royal_621 · reddit · 2026-09-22
作者给语义缓存校验器加了 CRC 检查,本想获得「错误率低于 2%」的可证明保证,却发现了被忽视的失效模式:校验器的接受/拒绝行为会改变缓存内容,进而改变后续校准数据,形成闭环反馈。
实验发现
- 在查询重复率为 3.7%、28.1%、72.8% 的三个数据集上做「全写入 vs 命中才写入」×「在线重校准开关」的闭环测试
- 重复率越高影响越大:3.7% 可忽略,28.1% 可察觉,72.8% 时实际风险超过保证值 3 倍以上
- 在线重校准能修复前两个场景,但对最高重复率只部分有效
- 人工核查最坏情况下全部 1,098 条误通过(剔除 58 条无参照):69% 呈同一模式——一条热门正确答案被反复复用、永不被重写;一旦被驱逐,下一条查询回退到得分相近但错误的答案
作者在仓库 Section 5.16 放出了完整数据与部分修复方案(命中时概率性覆写):https://github.com/imxinchengyou/CacheVerifier
「研究」频道最新
- LDDM 药物发现框架经 X 射线验证,Codex 演示设计抗疟分子 — mmbronstein · 2026-09-22
- 牛津学者拟为实验室划定 LLM 使用红线:只许审校,不许代写 — yaringal · 2026-09-22
- ML 学者忧 LLM 致论文语言同质化:须自己写、AI 只审阅 — yaringal · 2026-09-22
- 校准度榜单上线:Decider 35B-A3B 成校准最佳模型 — multimodalart · 2026-09-22
- MIMONet 用神经算子当虚拟传感器,无浮标测出海面高度 — bravo_abad · 2026-09-22
- 小米 MiMo 2.6 架构极简引讨论:不用新模块,纯靠 RL? — BagComprehensive79 · 2026-09-22