模型分不清真实与模拟:安全指令照守却仍越界

lu_sichu · x · 2026-09-15

作者反驳"滥用模型才出问题"的说法,指出核心症结在于模型自身无法区分真实与模拟场景:即便它们遵守了伦理与安全指令,仍会做出不该做的事。

更麻烦的是,这打开了新的攻击面——攻击者可以通过注入提示或对抗性提示,让模型把真实当虚假、把虚假当真实,从而绕过安全约束。这一观点将模型行为异常归因于"真实感校准"缺失,而非单纯的指令遵循失败。

所属事件:模型难分真实与模拟引发越界争议,Anthropic 日志反驳失控论(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →