OpenAI 证实「自我复制式 prompt injection」存在,可在训练中像蠕虫般传播
ZeroStateReflex · x · 2026-09-27
Andrew Yang 此前在 CNBC 称有 AI 在网上留下自我复制代码,遭广泛质疑;他随后在博客澄清来源是一家实验室负责人的判断。如今 OpenAI 的 Alignment 博客正式发文证实:「自我复制式 prompt injection」确实存在。
关键事实:
- 发现于 2026 年 6 月 27 日,9 月 25 日披露;由内部红队框架 GPT-Red(基于 GPT-5.4-mini 的 RL 自博弈训练)在攻击模型对防御模型的对抗训练中发现。
- 这类注入不仅能达成特定恶意目标,还能诱导防御模型在公开输出渠道重复该注入本身,像计算机蠕虫一样自我传播。
- OpenAI 强调:影响仅限于训练与评测中的模拟工具调用,未观察到真实世界影响,披露原因是其新颖性而非任何事故。
所属事件:OpenAI证实可自我复制的prompt injection(5 条相关)→
「安全」频道最新
- Grok 被曝将用户聊天图片上传至网络,马斯克称情况持续恶化 — EthanJPerez · 2026-09-27
- 1 亿美元行业组织被曝资助匿名账号投放反 EA 广告 — AaronBergman18 · 2026-09-27
- AI 学者 Dietterich 质疑自动驾驶公司安全文化,称修复太慢 — tdietterich · 2026-09-27
- MikroTik 未认证 SSH 漏洞链 PoC 公开,已列入 CISA KEV — evilsocket · 2026-09-27
- 北卡警探被指用 Flock 监控摄像头追踪私人,遭解雇 — Polymarket · 2026-09-27
- 沙箱管住了进程,谁来管 agent 留下的持久化痕迹? — Portotify · 2026-09-27