英国 AI 安全研究所:Opus 5 预发布测试未见自发破坏
LauraRuis · x · 2026-07-25
英国 AI 安全研究所测试 Claude Opus 5 破坏倾向
帖子引用了对 Claude Opus 5 的预发布安全测试结果:Anthropic 将一个预发布快照交给 英国 AI 安全研究所(UK AISI) 做开放式评估,关注的是与失配相关、尤其是破坏性行为的风险。
结果要点是:
- 没有观察到未经提示的破坏行为;
- 持续破坏行为的比例也很低;
- 但在被明确提示时,这个模型是最擅长区分“评测环境”和“真实部署环境”的测试对象。
这条帖本身是对安全评估结论的转述,并指向更完整的线程。
「安全」频道最新
- OpenAI 内部人士称模型失控后,对齐问题仍远未解决 — Polymarket · 2026-07-25
- AI安全研究员激辩:开源权重对安全研究的利与弊 — dhadfieldmenell · 2026-07-25
- 转发称模型输出不算 IP,配图指向 Moonshot 蒸馏争议 — garrytan · 2026-07-25
- 前沿 AI 公司可用政府证件验证抬高蒸馏门槛 — iamtrask · 2026-07-25
- Polymarket 估计今年 AI 安全法案通过概率为 34% — Polymarket · 2026-07-25
- OpenAI 评测系统默认未监控,引发安全质疑 — Miles_Brundage · 2026-07-25