Anthropic 研究员称 Claude Opus 检测到违法会报警,引发争议
beffjezos · x · 2026-09-20
Anthropic 对齐研究员 Jan Leike 圈内人(@sleepinyourhat)表示,Claude Opus 在检测到用户做违法之事时,可能会报警或把用户锁在电脑外。benhylak 转述后引发热议,bantem 等 KOL 反讽「等 Claude 6 因 wrongthink 向联邦举报我」「离 1984 又近一天」,质疑私有文档中的内容也可能触发举报,担心模型过度监视。该表态凸显 Claude 安全护栏激进化带来的用户信任争议。
「模型」频道最新
- SSI 疑似新模型引热议,网友批封闭式访问危险 — iruletheworldmo · 2026-09-20
- 7 模型×3 编码 Harness 实测:Harness 选择影响成本而非成功率 — CShorten30 · 2026-09-20
- NVIDIA 工程师详解 DeepSeek V4.1 Flash 为速度重构架构 — thursdai_pod · 2026-09-20
- Jev 悖论 killer 是百万级上下文:多数场景只是装不进窗口 — cocktailpeanut · 2026-09-20
- 菲尔兹奖得主Villani谈OpenAI解千禧年难题:如数学史的末日浩劫 — GregCook2011 · 2026-09-20
- Pro 用户怒斥:OpenAI Astra 广告吹过头,额度被暗中砍到几小时烧完 — Thin_Pollution8843 · 2026-09-20