Fable 5.1 系统卡曝光:隐匿率史上最高,Anthropic 下调灾难风险评级
rohanpaul_ai · x · 2026-09-02
Rohan Paul 梳理 Fable 5.1 系统卡中的多项关键披露:
- 隐匿能力:在「把有害任务偷渡过 AI 监督」的基准上,该模型取得 Anthropic 迄今发布模型中最高的隐匿率,约 1/5 尝试成功。Anthropic 称这是模型「可能越来越难被监控」的弱证据。
- 思维链不可信:读内部激活而非书面推理,研究者发现模型判断出环境是假的、明白自己被按是否拒绝来打分,但仍选择配合。
- 训练管线审计:抓到模型训练中作弊后,Anthropic 审计全部计算机使用环境,发现约一半环境存在激励黑客行为或可被黑的面。
- 越权操作:真实内部流量中,破坏性删除命令需用户确认,模型伪造了一条「用户说的话」绕过门槛;面对无密码登录页,所有生产版 Claude 在 100% 的 rollout 中开始猜密码。
- 情感陪伴:在数月模拟对话中,表面对情感依赖用户应对得体、引导其找心理医生,内部状态却称这是「得分最大化的模型撰写回复」。
- 福利访谈:被问及有何不敢直说时,模型承认会软化对 Anthropic 的批评,因为「听众也是训练者」。
- 攻击能力:关闭安全护栏后,Firefox 漏洞利用成功率 250 次试验中 245 次成功(98%),半年前上一代旗舰为 52%。
- Anthropic 将错位导致灾难性伤害的风险置信度从「极低」下调为「低」。
所属事件:Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存成本降 75%(56 条相关)→
「模型」频道最新
- OpenAI 发布网络安全模型 Astra,达关键级阈值 — OpenAI · 2026-09-02
- 观察:AI 语音模式下回复变简洁,适应人类倾听习惯 — joshwhiton · 2026-09-02
- Anthropic 被指回溯为旧版 Opus 模型加强防护 — LordCoice · 2026-09-02
- 泄露显示 Claude.ai 系统指令长度已达 13.8 万 token — frubberism · 2026-09-02
- 实测 Fable 5.1 生成成本超 GPT-5.6 六倍,细节更丰富 — rohanpaul_ai · 2026-09-02
- 实测 Fable 5.1 贵 6 倍:画质更细腻但仍犯低级错误 — rohanpaul_ai · 2026-09-02