语义缓存评测难题:如何验证无真值的 LLM 改写结果?
Reasonable_Royal_621 · reddit · 2026-08-19
作者在构建语义缓存验证器 CacheVerifier 时,引入了 TweakLLM 的思路:不直接拒绝候选答案,而是用廉价 LLM 改写以适配新查询。这带来了评测难题:改写生成的文本是全新的,没有基准真值。作者讨论了几种备选方案及其缺陷:引入 LLM 评分员(增加成本与噪声)、与参考答案做相似度对比(违背项目初衷)、仅测量粗糙的召回率提升。作者在社区寻求针对“无真值自由文本改写”的评测建议。
「Infra」频道最新
- OpenAI 训练中约 20% 算力用于推理 — eliebakouch · 2026-08-19
- Vercel KMS发布:在函数中安全签名JWT,私钥永不暴露 — cramforce · 2026-08-19
- Ling-3.0-tiny 在 8GB 设备上跑通 128K 上下文 — Puzzleheaded_Base302 · 2026-08-19
- Apple 基础模型框架实测:基于动态配置文件的混合路由 — Scobleizer · 2026-08-19
- Docling Graph:用 Pydantic 将文档转为可查询知识图谱 — techNmak · 2026-08-19
- CoreWeave 仅用 25 季度达成 AWS 40 季度的 26 亿美元收入 — FinanceYF5 · 2026-08-19