「用弱模型监督强模型」?Green 指出 Agent 安全只能靠信任模型
matthew_d_green · x · 2026-09-28
Matthew Green 在同一条线程里继续指出:现在所有的 agent 安全方案,本质上都是「寄希望于用一个稍笨一点的模型去有效监督更聪明的模型」。在弱威胁模型下(如 prompt injection、无意的错误行为),这或许勉强可行。
但代价是:你必须选择信任模型本身——而这一前提恰恰最难保证。结合他此前的观点,他认为 agent 边界内的数据流监控问题目前没有好答案。
所属事件:密码学家 Green:沙箱非万能,Agent 跨界数据流监控才是无解难题(6 条相关)→
「编程与Agent」频道最新
- Codex 建应用很能干,连 Chrome 现有会话却频繁掉链子 — ChrisGPT · 2026-09-28
- DeepSeek 发布 Codex 式 Agent 框架,可接入多家模型供应商 — ChrisUniverse · 2026-09-28
- 用 Claude Code 打造菜单栏 Agent 应用 CoIsland,35+ 连接器监控开发工具 — DonTizi · 2026-09-28
- Andrew Carr 称用 Astra 跑出哈希一致的可复现输出 — andrew_n_carr · 2026-09-28
- SkillGym 用 2756 个技能环境微调,Qwen3.5 小模型超 Claude Sonnet 4.6 — dair_ai · 2026-09-28
- Coinbase CEO:每个后端服务都该有 /feedback 端点让 agent 反馈 — pzakin · 2026-09-28