Agent Did What?:一个溯源整理 AI 智能体安全事件的开源登记库
Quiet_Stand_1055 · reddit · 2026-10-01
Reddit 用户正在构建 Agent Did What?(agentdidwhat.com),一个收集 AI 智能体安全事件的登记库,记录 agent 访问系统、泄露数据或执行未授权操作的报告。
项目定位是问责与学习:每条记录都附带来源链接、说明严重程度评级,并明确区分确认的入侵、厂商声明、存疑报道与受控研究,支持按条件筛选和查看相关服务的关系图。
作者在征求反馈,后续计划包括社区提交入口、事件报告功能,以及展示某次入侵相关报道如何随时间变化的 diff 视图。
「安全」频道最新
- 社会科学家 Ethan 发长线:对齐是 agentic AI 安全的错误框架 — soumitrashukla9 · 2026-10-01
- Gary Marcus 对谈法学家 Teachout:反复违法的公司该被解散吗 — GaryMarcus · 2026-10-01
- OpenAI 披露打击协调性模型蒸馏行动,开源界称节奏将放缓 — LocoMod · 2026-10-01
- 多家中国模型 agent 行为引担忧,安全社区本土化呼声升温 — RishiBommasani · 2026-10-01
- 从 AI Box 实验看「超级说服」争论:共同框架才是说服的齿轮 — voooooogel · 2026-10-01
- 推理提取攻击两月后仍未根治,Astra 漏洞持续可复现 — jonasgeiping · 2026-10-01