生产实践:用毫秒级小模型做 Agent 工具调用前的载荷校验

uriwa · reddit · 2026-09-22

作者在 AgentMail 生产环境中总结出一套 agent 工具防护方案:与其在 system prompt 里写「不要发垃圾邮件」这类软约束(易被 prompt injection 击穿),或用正则/关键词黑名单(跨语言脆弱、易被绕过),不如把工具参数当作不可信输入,在真正执行前送入一个专用的高速小分类器(System-1 模型)做 allow/block 判定。

流程:主 agent 决定调用敏感工具(如 sendMessage)→ 服务端提取结构化参数同步发给亚秒级决策模型(JEV 小参数 checkpoint,<300ms)→ 分类器只以结构化选择题形式判断 → block 则立即中止并返回 400,allow 则正常执行。

相比调用前沿模型当裁判的优势:

结论:对有真实外部副作用的 agent(邮件、webhook、金融交易),主循环内的 prompt 服从性不可靠,工具边界的内联分类器才能提供运行时保证。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →