Competence Gate:用小模型内部置信度信号控制工具调用
Synthium- · reddit · 2026-07-05
作者为Qwen3.5-4B做了一个10MB的LoRA适配器加编排层,按每条查询决定是直接回答、联网搜索还是检索本地文档,无法核实时拒绝编造。核心思路是:小指令模型不擅长口头表达自身置信度(测过7个3–9B模型都撞到置信度天花板),但内部激活里其实含有该信号,适配器直接读取并据此给工具调用设门。实验显示:相比基础模型的工具调用,该门控更擅长抓错(d′提升0.46,95% CI [0.01,0.89]),其多标记的案例中87%确实答错;双信号版本还能把含隐私问题路由到本地检索,使隐私问题被发往公网搜索的比例从22%降到10%。可在Apple Silicon/MLX本地运行,并提供GGUF版本。
「编程与Agent」频道最新
- 开发者把 Claude Code 和 Codex 历史合并成千万级消息归档 — doodlestein · 2026-07-27
- 谷歌 15 个免费 AI 工具覆盖营销、编程和音乐 — aigclink · 2026-07-27
- 9B Ollama Agent 可本地跑电台 DJ:工具、记忆和 TTS — pinku1 · 2026-07-27
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27