审计发现语义缓存基准 23% 的「错误命中」其实是同一 prompt
Reasonable_Royal_621 · reddit · 2026-10-02
CacheVerifier 团队做了语义缓存实验:用小验证器判断近重复 prompt 是否可复用缓存,对比单纯的相似度阈值。评测基于公开的 SemCacheLMArena 和 SemCacheSearchQueries 基准。
审计标签后发现问题严重:
- LMArena 上 3,117 个被标为「错误」的近重复命中中,727 个(23.3%)在小写化、去标点后文本完全相同——有的只是多了一个空格
- 盲测手工标注显示,88% 的「错误」命中其实完全可以复用
- 好消息:同一错误率下的横向对比结论基本不变;坏消息:绝对错误率被严重夸大——0.97 阈值的错误率从 5.2% 修正到约 0.95%
- 团队自己的一个结论反转:跳过验证器阈值提到 0.99 原来看是 +5.18 分,修正标签后是 -1.24 分,验证器只是在拒绝基准误判为错误的重复文本
作者建议:在对 eval 标签上调阈值之前,先跑一个朴素的完全相同文本检查。已开源 repo 和勘误。注意样本小、标注者仅一人。
「编程与Agent」频道最新
- Claude Code+OpenRouter+TTS:Deedy 视频工作流的环境搭建篇 — FinanceYF5 · 2026-10-02
- 六个编码 Agent 共享一个代码库实验:各写各的全崩,会聊天就全过 — jokiruiz · 2026-10-02
- 开发者用 AI 智能体 Astra 以纯程序化代码生成小镇角色素材 — Dimillian · 2026-10-02
- 开源 Médula:用廉价决策模型协调并行 Claude Code 互不踩脚 — jokiruiz · 2026-10-02
- 微软 FOCUS 论文:测试时压缩 Agent 上下文,峰值砍 48% — dair_ai · 2026-10-02
- DeepSeek 开源 Harness 智能体架构,桌面版开放测试 — deepseek_ai · 2026-10-02