审计发现语义缓存基准 23% 的「错误命中」其实是同一 prompt

Reasonable_Royal_621 · reddit · 2026-10-02

CacheVerifier 团队做了语义缓存实验:用小验证器判断近重复 prompt 是否可复用缓存,对比单纯的相似度阈值。评测基于公开的 SemCacheLMArena 和 SemCacheSearchQueries 基准。

审计标签后发现问题严重:

作者建议:在对 eval 标签上调阈值之前,先跑一个朴素的完全相同文本检查。已开源 repo 和勘误。注意样本小、标注者仅一人。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →