Multi-Head Latent Control 用隐状态减少 90.7% 大模型调用
HuaweiTech · hf · 2026-07-27
Multi-Head Latent Control:直接从 LLM 隐状态里读出路由决策
这篇论文提出 Multi-Head Latent Control,在冻结的 LLM/VLM 上方加一层轻量控制器,直接读取隐状态轨迹,输出部署时的控制信号。
- Capability Head 判断当前模型能否自己完成任务,还是应该转交更强模型。
- Resolution Head 判断当前实例更适合 追问更多信息、调用工具、直接作答,还是放弃/拒答。
- 训练只使用同一底座模型的隐状态轨迹,因此可以在不改模型本体的情况下做后验适配。
实验显示,这种做法能提升多模型路由系统的效果/成本比:
- 在“小模型 + 大模型”的路由执行中,AndroidWorld 上大模型调用量最高减少 90.7%,其他基准上平均减少 27%–53%,同时保留了大部分大模型性能。
- 工具调用决策也更准,最高带来 +158% 的相对分数提升,并减少 65.5% 的必需工具漏调用。
「编程与Agent」频道最新
- llmux 用一个 profile 管理 vLLM 和 llama.cpp 切换 — Available-Message509 · 2026-07-27
- Windows 数据库客户端工具想用单一 AI 订阅全流程开发 — Proud-Ticket-9379 · 2026-07-27
- 程序性记忆和检索记忆正在成为智能体基础能力 — goyalshaliniuk · 2026-07-27
- 图记忆与向量记忆构成现代 AI 检索栈 — goyalshaliniuk · 2026-07-27
- 情景记忆和语义记忆分别承载经验与事实知识 — goyalshaliniuk · 2026-07-27
- 短期与长期记忆是 AI 助手的基础层 — goyalshaliniuk · 2026-07-27