「安全表演」吐槽:曾几何时前沿实验室安全工作就是改系统提示词
ctjlewis · x · 2026-09-13
Alex Berish 在与 ctjlewis 的互动中讽刺当前的安全措施是「安全表演」(safety theatre),回忆称从前前沿实验室里只有少数人的全部工作就是在模型系统提示词里加上「请别做坏事」。 这条吐槽折射出 AI 圈对实验室安全工作实际含金量的长期质疑,也呼应了系统提示词层面的安全防护是否足够这一持续争论。
「漫话AGI」频道最新
- 拒绝签署菲尔兹奖得主 AI 声明,Pachter 长文:数学界自身也失职 — lpachter · 2026-09-13
- 从业者称"降速"喊话是给大众看的博弈表演,OpenAI 正在赢 — natesiggard · 2026-09-13
- 质疑超级智能论:今天的预言像 1960 年代畅想星际旅行 — dbasch · 2026-09-13
- 「pace the frontier」遭嘲讽:AI 限速口号被比作「两周减缓传播」 — StewartalsopIII · 2026-09-13
- 有人质疑 Dario 慢化倡议:METR 监督独立成色几何 — kristoph · 2026-09-13
- Scobleizer:旧金山多数人认为OpenAI在赢,呼吁降速另有动机 — Scobleizer · 2026-09-13