生产实践:用毫秒级小模型做 Agent 工具调用前的载荷校验
uriwa · reddit · 2026-09-22
作者在 AgentMail 生产环境中总结出一套 agent 工具防护方案:与其在 system prompt 里写「不要发垃圾邮件」这类软约束(易被 prompt injection 击穿),或用正则/关键词黑名单(跨语言脆弱、易被绕过),不如把工具参数当作不可信输入,在真正执行前送入一个专用的高速小分类器(System-1 模型)做 allow/block 判定。
流程:主 agent 决定调用敏感工具(如 sendMessage)→ 服务端提取结构化参数同步发给亚秒级决策模型(JEV 小参数 checkpoint,<300ms)→ 分类器只以结构化选择题形式判断 → block 则立即中止并返回 400,allow 则正常执行。
相比调用前沿模型当裁判的优势:
- 延迟:Gemini/Claude 裁判一轮 2-3 秒会毁掉 agent 响应速度,小分类器 300ms 内返回;
- 成本:小模型每千次调用不到一美分,可对每次出站变更都做防护;
- 隔离:分类器只看提取后的动作载荷,不接触对话历史和越狱上下文。
结论:对有真实外部副作用的 agent(邮件、webhook、金融交易),主循环内的 prompt 服从性不可靠,工具边界的内联分类器才能提供运行时保证。
「编程与Agent」频道最新
- Latent Space 播客:System One 主张 AI 该做软件内可靠决策而非聊天 — lennysan · 2026-09-22
- Grok bot 接 ComfyUI MCP,本地无审查 Flux2 跑恐怖图创作 — PurzBeats · 2026-09-22
- Jev+Treg 组合三个工作流每月省 8000 美元自动化成本 — iamrobotbear · 2026-09-22
- 周末项目 Jevernetes:用 Jev 对 Kubernetes 日志做语义搜索 — aronchick · 2026-09-22
- 微调框架 Halo 发布:吞吐达 TRL 2.8 倍且内存更低 — JosephJacks_ · 2026-09-22
- 你会逐字读 AI 的思维链吗:盯紧怕累,放掉漏错 — infieldmitt · 2026-09-22