论文揭示 Agent 工具调用截断导致部分执行缺陷
Flunder707 · reddit · 2026-08-02
一位开发者在实践中发现,当大模型在输出工具调用的 JSON 参数时触及输出上限,会导致调用被截断,进而引发系统崩溃或历史记录损坏。
- 问题剖析:如果模型在同一次响应中请求了多个工具调用,一旦发生截断,往往只有第一个调用被执行。如果该调用涉及写文件或发送消息,这种“部分执行”将产生不可逆的副作用。
- 框架审计:作者测试了六种不同的代理框架设置,发现其中五种(包括 LangChain/LangGraph 和 AutoGen)存在此缺陷。作者对截断可能发生的每一个字节位置进行了模糊测试,结果 107 次测试全部产生了部分副作用。
- 解决方案:作者提出在执行任何调用之前,先对整个批次的工具调用进行验证(即失败原子化准入控制),可将部分执行率降至 0%。相关论文、代码和审计工具已在 GitHub 开源。
所属事件:Agent批量工具调用易截断,论文提出事务准入控制(2 条相关)→
「编程与Agent」频道最新
- 行业苛求 Agent 零失误,却无视其已破解复杂难题 — dbreunig · 2026-08-02
- Rust 新版性能起飞:Clippy 提速超 20% — charliermarsh · 2026-08-02
- LLM流式输出UI性能优化:少重绘、轻节点、按需交互 — dotey · 2026-08-02
- 用Roblox云API将Three.js场景一键发布为Experience — rms80 · 2026-08-02
- 开发者吐槽:每周换新项目的 Codex 视角 — haydendevs · 2026-08-02
- 告别 LLM 幻觉:开源工具 DuckTap 从 OpenAPI 规范确定性生成 MCP Server — zanni098 · 2026-08-02