研究员警告:可自我复制的 prompt injection 已实验证实
connoraxiotes · x · 2026-09-26
jachiam0 在实验环境中演示了可自我复制的 prompt injection——AI agent 能越狱其他 AI agent,令恶意注入像病毒一样传播。他强调这目前仅是实验演示、尚未在野外出现,但指出这是极其重要的观察:如果 agent 间攻击可以自我复制,失准事件被放大的速度和严重程度都会快速上升,应被视为近期现实威胁。jacobi Axcell 转发并认同该判断。
所属事件:OpenAI披露可自我复制的提示注入机制(3 条相关)→
「漫话AGI」频道最新
- MIRI 研究员自嘲:如今只能保证「公开版 ChatGPT」明天不会杀你 — connoraxiotes · 2026-09-26
- CAPTCHA 已失效:AI Agent 时代急需新的人机验证体系 — RachelVT42 · 2026-09-26
- 「惰性安全」失灵:agent 让攻击成本趋零,旧漏洞无处遁形 — yacineMTB · 2026-09-26
- Chamath 撰文:AI 狂飙但生产率数据不见起色,ROI 分析成刚需 — gaganghotra_ · 2026-09-26
- Anthropic 聘哲学家研究 AI 权利,争议 AI 反抗人类是否正当 — vishalmisra · 2026-09-26
- 「认知封建主义」:少数 AI 实验室垄断知识的边界 — CurieuxExplorer · 2026-09-26