给个人 Agent 开放邮箱和文件后,他把安全模型浓缩成一条规则

SIGH_I_CALL · reddit · 2026-09-08

一位开发者构建了能读邮件、文件和屏幕并执行操作的个人 agent,发现安全工作的重心不该是让模型足够聪明去识别 prompt injection,而应假设它终将被骗。

他最终落定一条硬规则:私密数据 + 不可信内容 + 对外发送通道 = 硬性阻断。恶意网页或有毒邮件单独存在未必致命,危险状态是 agent 能在同一链路中读取不可信指令、接触隐私数据并向外发送信息。

于是他不再试图检测每一次注入,而是限制哪些能力允许共存:某些状态转换要么需要人工批准,要么在结构上不可能发生。他提出 agent 安全的核心问题正从「模型能否识别攻击」转向「模型必然被骗时,系统能做什么」,并公开了架构与威胁模型文档。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →