Cactus Hybrid 用 6.8 万参数探针给 Gemma 4 做置信路由
Henrie_the_dreamer · reddit · 2026-07-23
Cactus Hybrid 让 Gemma 4 学会判断自己是否答错
Cactus 发布了一个名为 Cactus Hybrid 的方案:给 Gemma 4 E2B 加上一个很小的探针层,让模型在回答时先估计自己是否可能出错,再据此决定要不要把请求转交给更大的云端模型。
- 方案里加入了一个 68k 参数 的 probe layer,从中间层隐藏状态读取信号,直接预测 p(wrong)。
- 输出的是结构化置信度,而不是靠解析模型生成的自然语言自评。
- 在 12 个留出测试集上,这个 probe 的平均 AUROC 为 0.814,明显高于 token entropy 的 0.549。
- 作者还称,probe 完全没用音频数据训练,但在多个音频基准上仍能达到 0.79–0.88 AUROC,说明它捕捉到的是更通用的“自知错误”信号。
- 通过只把 15%–35% 的请求转给 Gemini 3.1 Flash-Lite,他们声称 Gemma-4-E2B 能在多数基准上接近后者表现。
- 代码和权重已经放出,支持 Hugging Face、Transformers、MLX、llama.cpp 等多种栈。
这是一个把“本地优先 + 云端兜底”做成可训练、可量化系统的研究型方案。
「编程与Agent」频道最新
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- Claude Code 桌面版新增 UI 标注反馈编辑 — EricBuess · 2026-07-27
- Anthropic 称 Claude Code 删掉 80% 系统提示词仍不掉分 — krishnan · 2026-07-27