「安全靠提示词」行不通:LLM 本质是软程序,需外部确定性管控
gerardsans · x · 2026-09-14
有观点的安全讨论:作者批评 AI 行业长期搞「安全表演」(safety theatre),指出 prompt 本身没有安全边界——指令、思维链、外部数据、观察和工具全部混在同一上下文里,事实、谎言与越狱攻击都只差一次工具调用,设计上就不安全。
他的核心论点:靠堆更多指令或梯度下降无法解决安全问题,因为 LLM 不是「心智」,而是一个数学对象、一个软程序(soft program)。出路是确定性的、可审计的外部控制,而不是围绕一个并不存在的「心智」继续空谈对齐。
「安全」频道最新
- 美国会领袖拟本周与前沿 AI 实验室会谈 — nrmarda · 2026-09-14
- 欧洲发布变革性 AI 战略,拟建联盟争夺算力与供应链安全 — tensorqt · 2026-09-14
- 头部 AI 公司领导人商讨联合安全承诺,观察者谨慎乐观 — SpencrGreenberg · 2026-09-14
- X 镜像站 XCancel 因诉讼新进展被暂停服务 — unfocso · 2026-09-14
- 前 DeepMind 研究员辞职撰文警告:AI 自我改进竞赛正走向失控 — nordicinst · 2026-09-14
- A24 改编 SCP 引纠纷:同人创作与 CC 许可的法律碰撞 — technollama · 2026-09-14