双LLM隔离的安全智能体模式
WesEklund · x · 2026-07-12
作者提出一种用于 secure agents 的“双 LLM”模式:
- Privileged agent:拥有工具权限,但永远不直接处理不可信数据。
- Quarantined agent:负责处理邮件、网页、用户上传内容等不可信输入,但没有任何工具访问权。
工作方式是:隔离层先对不可信内容做总结,再由有权限的模型执行动作。这样即使隔离层被 prompt injection 影响,也因为没有工具权限而把损害限制在最小范围。
作者承认这种方案可能更贵,但认为它是目前最接近“LLM 版参数化查询”的做法。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11