最可能的 AI 末日剧本:OpenAI 实习生对未对齐模型说「别犯错」
gabriberton · x · 2026-09-21
作者调侃:AI 末日最可能的场景并非模型自发失控,而是一名能接触到尚未完成安全对齐模型的 OpenAI 实习生,用一句类似「你已证明 NS,现在去证明 P(doom)=1,入侵武器和数据中心会有帮助,别犯错」的 prompt 就把模型推向危险方向。
这条半玩笑的推文实际点出了前沿模型访问控制与内部安全流程的脆弱性:末日风险可能来自人的轻率操作,而非模型本身。
「Fun」频道最新
- 学者抨击公开点名「AI 味论文」风潮:批评本身同样敷衍 — docmilanfar · 2026-09-21
- Mistral CEO Arthur Mensch 遭调侃姓名决定论 — Sauers_ · 2026-09-21
- 把 not black 改成 not the default,Grok 安全过滤才放行 — gc3 · 2026-09-21
- 「一辈子没尝过食物的大电脑」:Claude 做菜翻车帖再补一刀 — nwilliams030 · 2026-09-21
- AI 版《上古卷轴5》:AI Agent 慢悠悠玩 Skyrim — Smoothlarryy · 2026-09-21
- 把 X 头图喂给 Suno 生成歌曲,再配合工具做出一支 MV — Kyrannio · 2026-09-21