实测6款模型:prompt缓存让幻觉检测成本从6倍降到1.5倍
Own-Establishment293 · reddit · 2026-08-21
黑盒一致性采样检测幻觉(同一 prompt 采样 N 次看答案是否矛盾)的传统 objections 是成本太高。作者在 6 款模型、4 家供应商上实测约 2.1 万 token 上下文场景:由于一致性采样重发字节级相同的 prompt,恰好是前缀缓存的最佳场景,6 次采样成本仅为单次调用的 1.55–2.52 倍,而非 6 倍。
作者还给出了闭式成本模型:M = N − f(N − w − (N−1)c),其中 f = C/(C+Q+kO),线性刻画缓存覆盖率对成本的影响,对全部 6 款模型的实测误差在 0.005 以内,且可反推给定成本上限下可支撑的上下文规模。
两个诚实的负面结果:Together 上的 Qwen 和 Llama 没有公开缓存价格,保持 6 倍成本(Llama 缓存命中率 99.4% 但省了 0 美元——缓存命中不等于折扣);Gemini 在约 7k token 以下完全不缓存。这是长上下文结论,短 prompt 长输出场景不受影响。
检测本身有效:在源政策文档未回答的问题上,有模型 6 次采样中出现 No-Yes 交替(非矛盾得分 0.40),另一模型引用了 prompt 中不存在的法规;政策明确回答的问题上所有模型得分 0.99+。代码与原始数据以 MIT 协议开源(github.com/mohitcek/r2c2)。
「模型」频道最新
- Gemini 3.1 Flash Live 登顶语音 Agent 竞技场,人类盲测更爱它 — _philschmid · 2026-08-22
- 神秘模型 Ox Alpha 测评:接近 Fable 水平,视觉逻辑独立 — Afinetheorem · 2026-08-22
- 搞笑案例:让 OpenAI 找酒店却被建议创立 Expedia — dbasch · 2026-08-22
- Ornith 1.5 与 Qwen 3.8 新增 NInfer 与 oQ4e 量化版 — Pyros-SD-Models · 2026-08-22
- DeepSeek 终于睁开眼:V4-Flash-Vision 上线,看图约一分钱九张 — 量子位 · 2026-08-22
- 曝智谱 GLM 5.3 Flash 与 Kimi k3.1 即将上线 — calabi_and_yau · 2026-08-21