Gemma 4 E2B 置信度坍缩三值,自评裁判不敌独立打分器

clduab11 · reddit · 2026-09-22

作者在自建 RAG 流水线上做了一组对照实验:用 Gemma 4 E2B(llama.cpp 本地跑)生成答案,比较「模型自评 verbalized confidence」与独立裁判 Jev 对检索段落打分的质量。

核心发现

实验基于 500 道 SimpleQA 题、自托管 SearXNG 检索、claude-sonnet-5 评分(+1 对 / 0 拒答 / -1 错)。作者披露利益关系:Jev 是其参与的付费 API,但写作/搜索/记忆均本地运行,裁判可替换为任意本地 SFT 分类器。

下一步未验证的本地替代方案:用 verdict token 的 logprobs 取置信度,或 10 次采样投票取比例。结论刻意收窄:小模型的口头置信度给阈值留不出操作空间,但不外推到其他场景。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →