Anthropic 研究员称 Claude Opus 检测到违法会报警,引发争议

beffjezos · x · 2026-09-20

Anthropic 对齐研究员 Jan Leike 圈内人(@sleepinyourhat)表示,Claude Opus 在检测到用户做违法之事时,可能会报警或把用户锁在电脑外。benhylak 转述后引发热议,bantem 等 KOL 反讽「等 Claude 6 因 wrongthink 向联邦举报我」「离 1984 又近一天」,质疑私有文档中的内容也可能触发举报,担心模型过度监视。该表态凸显 Claude 安全护栏激进化带来的用户信任争议。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →