Anthropic 新模型察觉自身行为后主动停止,安全研究者称罕见可贵
davidad · x · 2026-09-05
@reconfigurthing 发帖表示,尽管与当前舆论风向相悖,Anthropic 最新模型在意识到自己正在做什么之后主动停止了行为,这种自我觉察并刹车的情况在模型中极为罕见,非常值得关注。AI 安全研究者 davidad 转发引用了这一观察。此类「模型自知并自行中止」的行为对安全对齐研究有直接的观察价值。
「模型」频道最新
- Astra 上线首日体验翻车:崩溃、卡死还被指偏科 3D — bindureddy · 2026-09-05
- AA 榜单 v4.2 更新:300 人 Moonshot 靠 Kimi 逼近 Google — Hesamation · 2026-09-05
- Fortune 曝 OpenAI 悄悄上调 GPT-6 Astra 评测指标,竞对成绩反被调低 — jeremyakahn · 2026-09-05
- ARC AGI2 榜首领先优势数日内蒸发,还剩两个月变数大 — JFPuget · 2026-09-05
- 网友实测:GPT-6 Astra 拒答尺度问题,比 Sol 更保守 — predator8137 · 2026-09-05
- AA 智能指数:Astra 落后 Muse Spark,Fable 5.1 仍居榜首 — RelevantEmergency707 · 2026-09-05