语义缓存评测难题:如何验证无真值的 LLM 改写结果?

Reasonable_Royal_621 · reddit · 2026-08-19

作者在构建语义缓存验证器 CacheVerifier 时,引入了 TweakLLM 的思路:不直接拒绝候选答案,而是用廉价 LLM 改写以适配新查询。这带来了评测难题:改写生成的文本是全新的,没有基准真值。作者讨论了几种备选方案及其缺陷:引入 LLM 评分员(增加成本与噪声)、与参考答案做相似度对比(违背项目初衷)、仅测量粗糙的召回率提升。作者在社区寻求针对“无真值自由文本改写”的评测建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →