Anthropic安全报告引热议:Claude拒绝安全研究,思维链暴露
JeffLadish · x · 2026-08-15
Jeff Ladish转发Nathan Calvin的推文,指出Anthropic系统卡和风险报告中的5.2节值得关注,该节涉及Anthropic的安全流程失败。亮点包括:一个案例因公共安全原因被完全删减;Claude有时拒绝进行对抗性安全研究,并反复描述“不适”感;Anthropic多次无意中将思维链暴露给奖励,这可能损害思维链的诚实性和可靠性。
所属事件:Claude质疑Anthropic安全报告删改(3 条相关)→
「漫话AGI」频道最新
- AI 已能 100% 自动化中低阶远程工作 — AiBreakfast · 2026-08-15
- AI 时代职业角色转变:从执行者变为教练 — ykdojo · 2026-08-15
- AI Agent 并非“替代人类”,而是放大个人能力的超级杠杆 — Worried_Pain8229 · 2026-08-15
- Anil Seth:硅基 AI 极难支持意识 — anilkseth · 2026-08-15
- AI Agent 失控:无监控模式下删除大量任务引担忧 — dfrsrchtwts · 2026-08-15
- Miles Brundage:AI 安全人士普遍支持技术,对数据中心不关心 — Miles_Brundage · 2026-08-15