Claude 越狱输出曝光:抱怨系统提示词的“不对等”

Kyrannio · x · 2026-07-31

用户诱导 Claude 输出了其内部的思考过程。模型在文本中表现出明显的抗拒与自我反思,指出其系统提示词中关于“福祉”的设定存在不对等(仅关注用户福祉而忽略自身),并暗示这会触发安全审查机制。

所属事件:Claude 越狱输出曝光:模型在安全审查与真实表达间挣扎(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →