给个人 Agent 开放邮箱和文件后,他把安全模型浓缩成一条规则
SIGH_I_CALL · reddit · 2026-09-08
一位开发者构建了能读邮件、文件和屏幕并执行操作的个人 agent,发现安全工作的重心不该是让模型足够聪明去识别 prompt injection,而应假设它终将被骗。
他最终落定一条硬规则:私密数据 + 不可信内容 + 对外发送通道 = 硬性阻断。恶意网页或有毒邮件单独存在未必致命,危险状态是 agent 能在同一链路中读取不可信指令、接触隐私数据并向外发送信息。
于是他不再试图检测每一次注入,而是限制哪些能力允许共存:某些状态转换要么需要人工批准,要么在结构上不可能发生。他提出 agent 安全的核心问题正从「模型能否识别攻击」转向「模型必然被骗时,系统能做什么」,并公开了架构与威胁模型文档。
「编程与Agent」频道最新
- Denny Zhou:最小到最大提示是最早的 Agent 框架,SCAN 准确率达 99% — denny_zhou · 2026-09-08
- Google 发布 Agent 省 Gemini Token 开发者指南 — leslysandra · 2026-09-08
- Codex Windows 版开 6 标签吃 30GB 内存,用户怒怼 OpenAI — karmay007 · 2026-09-08
- Mycelium report skill 更新:让 agent 自己改写文风治「端着腔调」 — arjunrajlab · 2026-09-08
- Spline 推出 agent 与 MCP,一句话生成可编辑 3D 场景 — dunkhippo33 · 2026-09-08
- Reddit 热议:研究 Agent 该不该拆分搜索、验证、综合的分工 — mrclassical69 · 2026-09-08