Gemma 4 E2B 置信度坍缩三值,自评裁判不敌独立打分器
clduab11 · reddit · 2026-09-22
作者在自建 RAG 流水线上做了一组对照实验:用 Gemma 4 E2B(llama.cpp 本地跑)生成答案,比较「模型自评 verbalized confidence」与独立裁判 Jev 对检索段落打分的质量。
核心发现
- Gemma 的口头置信度几乎全部坍缩在 0.00/0.50/1.00 三个值上(top3 占 99.6%,落在 0.10–0.90 区间的仅 6.3%),导致阈值调节几乎无移动空间(gate mobility 仅 11%)。
- 在 473 个段落的配对测试中,Jev 排序质量 AUROC 0.926 vs Gemma 0.804(差 +0.122);Gemma 标 1.00 的 189 个段落里只有 40% 真含金标答案,而 Jev 在这些「Gemma 确信」的段落上仍能区分(AUROC 0.835)。
- 但端到端结果出人意料:全由 Jev 做决策的流水线得 0.612,反而输给无裁判基线的 0.740——主要因为拒答过多,未过预注册的主要指标线。
实验基于 500 道 SimpleQA 题、自托管 SearXNG 检索、claude-sonnet-5 评分(+1 对 / 0 拒答 / -1 错)。作者披露利益关系:Jev 是其参与的付费 API,但写作/搜索/记忆均本地运行,裁判可替换为任意本地 SFT 分类器。
下一步未验证的本地替代方案:用 verdict token 的 logprobs 取置信度,或 10 次采样投票取比例。结论刻意收窄:小模型的口头置信度给阈值留不出操作空间,但不外推到其他场景。
「编程与Agent」频道最新
- iPhone 镜像+computer use,本地实测 iOS 应用的新玩法 — var_epsilon · 2026-09-22
- 博主:界面清晰的垂直 Agent 或比通用聊天 Agent 更易养成习惯 — signulll · 2026-09-22
- Jev 实战演示:专攻有界决策的模型路由与代码评审仲裁 — kristiyanstoyanovAI · 2026-09-22
- 把 AI 从浏览器标签搬到桌面常驻后,真正变了什么 — LYKN-ai · 2026-09-22
- MCP 只解决了工具传输,没解决工具选择:agent 为何仍爱 grep — Wise_Reflection_8340 · 2026-09-22
- PowerShell 里玩转 Jev:把英文意图变成带概率的本地文件搜索 — dfinke · 2026-09-22