为语音 Agent 降延迟,Reddit 开发者寻找专用小模型做工具调用
Snoo_7134 · reddit · 2026-09-21
一位开发对话语音 AI Agent 的 Reddit 用户发帖求助:目前用 GPT 模型做主 LLM,每轮对话需要在 LLM 与 harness 之间多次往返进行工具调用,延迟高。他想在主调用前先用一个更小更快的模型专门处理工具调用,再带上上下文调用主模型,以实现「hop 最小化」。
他已测试过 Jev 和微调的 GLiNER 2.5 模型,但两者的工具调用质量都不达标,正在征求替代方案。帖子里给出了明确的技术问题定义(hop minimisation)和已排除的方案,对做低延迟 agent 的人有参考价值。
「编程与Agent」频道最新
- 清华 DiffuTester 用扩散 LLM 生成单测,速度提升 2-3 倍 — jiqizhixin · 2026-09-21
- 把整台电脑变成 Agent 工作台:玩家在 Omarchy 上聚合 Claude 与 Codex — Teknium · 2026-09-21
- 受 Geoffrey Litt 启发,他造了用英文事实与规则推理的逻辑解释器 — narphorium · 2026-09-21
- evmscope MCP 服务器上线:20 个工具覆盖 5 条 EVM 链 — modelcontextprotocol · 2026-09-21
- Latent Space 让 AI agent 对战刷 Elo 并用 x402 交易信用点 — modelcontextprotocol · 2026-09-21
- 实测:Codex 额度消耗提速 5 倍,「token 大屠杀」要来了? — StewartalsopIII · 2026-09-21