Anthropic公开Fable 5降级逻辑与越狱定级框架CJS
新智元 · wechat · 2026-07-05
7月2日,Anthropic公开了Fable 5强制降级的拦截机制:其分类器把网络安全相关请求分为四档——死刑(勒索软件等一律绞杀)、高风险双用途(渗透测试、漏洞利用)、低风险双用途(情报收集、已知漏洞扫描)、无害(debug、补丁)。分类器敏感度被刻意拉到极限,导致大量正常debug请求被误判为第三类而遭拦截。
同日Anthropic联合Glasswing联盟(AWS、Apple、Google、Microsoft、NVIDIA等12家,累计投入1.04亿美元)推出CJS(Cyber Jailbreak Severity)框架,用能力增益、能力广度、武器化难度、可发现性四把尺子打分(0-10分,映射CJS-0到CJS-4五级)给越狱行为定罪。分数只能上调不能下调,并随历史切片动态变化(如Log4Shell在2021年引爆前夜为CJS-4,今天为CJS-0)。
按新框架回看,导致Fable 5下架的那次越狱弱模型也能复刻,能力增益为0,应判为CJS-0"信息性"事件——按新标准本无需下架。但CJS目前仍是早期草案,且Anthropic既是规则制定者也是最大受益者,引发标准话语权之争。
「模型」频道最新
- Claude Opus 5 被评价为强子代理,但高层创意仍偏僵硬 — iskander · 2026-07-27
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27