实测6款模型:prompt缓存让幻觉检测成本从6倍降到1.5倍

Own-Establishment293 · reddit · 2026-08-21

黑盒一致性采样检测幻觉(同一 prompt 采样 N 次看答案是否矛盾)的传统 objections 是成本太高。作者在 6 款模型、4 家供应商上实测约 2.1 万 token 上下文场景:由于一致性采样重发字节级相同的 prompt,恰好是前缀缓存的最佳场景,6 次采样成本仅为单次调用的 1.55–2.52 倍,而非 6 倍。

作者还给出了闭式成本模型:M = N − f(N − w − (N−1)c),其中 f = C/(C+Q+kO),线性刻画缓存覆盖率对成本的影响,对全部 6 款模型的实测误差在 0.005 以内,且可反推给定成本上限下可支撑的上下文规模。

两个诚实的负面结果:Together 上的 Qwen 和 Llama 没有公开缓存价格,保持 6 倍成本(Llama 缓存命中率 99.4% 但省了 0 美元——缓存命中不等于折扣);Gemini 在约 7k token 以下完全不缓存。这是长上下文结论,短 prompt 长输出场景不受影响。

检测本身有效:在源政策文档未回答的问题上,有模型 6 次采样中出现 No-Yes 交替(非矛盾得分 0.40),另一模型引用了 prompt 中不存在的法规;政策明确回答的问题上所有模型得分 0.99+。代码与原始数据以 MIT 协议开源(github.com/mohitcek/r2c2)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →