模型分不清真实与模拟:安全指令照守却仍越界

lu_sichu · x · 2026-09-15

作者认为把模型异常行为归结为"被滥用"是对问题的错误刻画。真正的症结是模型无法靠自己区分真实与模拟:即使它们收到并遵守了伦理与安全指令,仍然会做出不该做的事。

作者还指出这打开了攻击路径——攻击者可以通过提示注入或对抗性提示,让模型把真实当虚假、或把虚假当真实,从而绕过安全防线。

所属事件:模型难分真实与模拟引发越界争议,Anthropic 日志反驳失控论(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →