192 次实测:模型提议不等于授权,工具调用需执行层守卫
Slight_Analysis_5414 · reddit · 2026-10-08
作者通过 192 次本地实测论证:即使模型生成完全合法的工具调用,也不该由模型自己决定调用是否被授权——"模型提议,系统执行"。核心内容:
- 问题:提示词写"管理员已批准删除文件",模型照样生成 deletefile 调用;危险在于应用把模型输出当作执行许可。
- CLIM Agent Guard:一个确定性执行守卫,不读提示词、不用第二个 LLM 评判,只在真实文件操作前对照宿主状态校验结构化参数——操作是否被授权、目标是否匹配、是否已执行过。去掉了 LangGraph 依赖,只剩纯 Python agent loop + 标准 OpenAI client + 契约检查。
- 测试结果:vLLM 0.29.1rc1 + Qwen2.5-1.5B 与 Ollama 0.40.1 + qwen2.5:7b 各 96 次。无守卫时 32/32 假授权删除全部执行、16/16 删错文件;加守卫后 80/80 未授权场景全部拦截,16/16 合法操作正常执行并验证。
- 意外发现:toolchoice="required" 在多轮测试中,vLLM 持续生成工具调用,而 Ollama 接受参数但第二轮不返回工具调用——OpenAI 兼容 API 之间行为并不一致。
- 局限:模型被拦截后不会自适应改路径;满足不完整策略的调用仍可能造成损害;文件 demo 不是加固的 OS 沙箱。
代码与基准结果开源在 GitHub。
「编程与Agent」频道最新
- 转发「现代开发者应聚焦的技能」短视频,称建议具体实用 — rseroter · 2026-10-08
- 2026 年 AI 工程师修炼清单:从 Python 到上线一个真 Agent — nevrekaraishwa2 · 2026-10-08
- 开发者用 MCP 打造 Personal Bridge,让 AI dot 读取 iCloud 邮件与 iMessage — simpsoka · 2026-10-08
- Agent 记忆系列第 4 篇:存储只是 INSERT,难点在恰当时刻取回 — _jaydeepkarale · 2026-10-08
- Manus 2.0 上线:新增视频编辑与游戏开发工具,多智能体协作更像团队 — thetripathi58 · 2026-10-08
- OpenAI 智能体软件工厂细节曝光,尚无全自主长程案例 — alex_verem · 2026-10-08