Competence Gate:用小模型内部置信度信号控制工具调用
Synthium- · reddit · 2026-07-05
作者为Qwen3.5-4B做了一个10MB的LoRA适配器加编排层,按每条查询决定是直接回答、联网搜索还是检索本地文档,无法核实时拒绝编造。核心思路是:小指令模型不擅长口头表达自身置信度(测过7个3–9B模型都撞到置信度天花板),但内部激活里其实含有该信号,适配器直接读取并据此给工具调用设门。实验显示:相比基础模型的工具调用,该门控更擅长抓错(d′提升0.46,95% CI [0.01,0.89]),其多标记的案例中87%确实答错;双信号版本还能把含隐私问题路由到本地检索,使隐私问题被发往公网搜索的比例从22%降到10%。可在Apple Silicon/MLX本地运行,并提供GGUF版本。
「编程与Agent」频道最新
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 开源工具 Claude Unlimited:多账号轮换让 Claude Code 会话不断线 — Similar_Injury_6739 · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11