为语音 Agent 降延迟,Reddit 开发者寻找专用小模型做工具调用

Snoo_7134 · reddit · 2026-09-21

一位开发对话语音 AI Agent 的 Reddit 用户发帖求助:目前用 GPT 模型做主 LLM,每轮对话需要在 LLM 与 harness 之间多次往返进行工具调用,延迟高。他想在主调用前先用一个更小更快的模型专门处理工具调用,再带上上下文调用主模型,以实现「hop 最小化」。

他已测试过 Jev 和微调的 GLiNER 2.5 模型,但两者的工具调用质量都不达标,正在征求替代方案。帖子里给出了明确的技术问题定义(hop minimisation)和已排除的方案,对做低延迟 agent 的人有参考价值。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →