Competence Gate:用小模型内部置信度信号控制工具调用

Synthium- · reddit · 2026-07-05

作者为Qwen3.5-4B做了一个10MB的LoRA适配器加编排层,按每条查询决定是直接回答、联网搜索还是检索本地文档,无法核实时拒绝编造。核心思路是:小指令模型不擅长口头表达自身置信度(测过7个3–9B模型都撞到置信度天花板),但内部激活里其实含有该信号,适配器直接读取并据此给工具调用设门。实验显示:相比基础模型的工具调用,该门控更擅长抓错(d′提升0.46,95% CI [0.01,0.89]),其多标记的案例中87%确实答错;双信号版本还能把含隐私问题路由到本地检索,使隐私问题被发往公网搜索的比例从22%降到10%。可在Apple Silicon/MLX本地运行,并提供GGUF版本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →