工具返回 4 万 token 怎么办?Reddit 热议 Agent 上下文裁剪三种方案
No-Age-3362 · reddit · 2026-10-09
Reddit 上一个 agent 工程实践讨论:搜索、日志查询或数据库读取动辄返回 4 万 token,而 agent 只需要其中几行——全量塞进上下文会烧 token 并触发 lost-in-the-middle,粗暴裁掉又可能丢掉关键一行。楼主列出三种候选方案并分析利弊:
- 硬截断 + 附注:告诉 agent 被裁了多少,需要时可再请求。便宜但盲目。
- 小模型预摘要:结果先经小模型压缩再给 agent。但摘要模型的错误 agent 无从察觉。
- 外部存储 + 句柄:完整结果存上下文之外,给 agent 一个引用句柄,配合分页/检索工具按需取用。最干净,但意味着更多工具和更多轮交互。
楼主询问大家实际在用哪种、在哪里踩过坑,评论区可见各家 agent 工作流对超长工具返回的真实处理经验。
「编程与Agent」频道最新
- Higgsfield 推出 Katana:在 Claude 内做 AI 视频剪辑 — CurieuxExplorer · 2026-10-09
- vLLM 生产环境坑:GPU 故障可致 K8s 节点报废,推理是有状态负载 — tianyin_xu · 2026-10-09
- Addy Osmani 长文:Agent 时代工程师的三种快乐,最先流失的是「直觉」 — addyosmani · 2026-10-09
- AI 质量检查第三步:相关性与指令遵循的自动化判定 — goyalshaliniuk · 2026-10-09
- AI 应用上线的 7 项自动化质检:测试全过也可能在生产翻车 — goyalshaliniuk · 2026-10-09
- 开发者吐槽:Codex/ChatGPT 需要「真正聪明」的模型路由器 — flowersslop · 2026-10-09