Anthropic公开Fable 5降级逻辑与越狱定级框架CJS
新智元 · wechat · 2026-07-05
7月2日,Anthropic公开了Fable 5强制降级的拦截机制:其分类器把网络安全相关请求分为四档——死刑(勒索软件等一律绞杀)、高风险双用途(渗透测试、漏洞利用)、低风险双用途(情报收集、已知漏洞扫描)、无害(debug、补丁)。分类器敏感度被刻意拉到极限,导致大量正常debug请求被误判为第三类而遭拦截。
同日Anthropic联合Glasswing联盟(AWS、Apple、Google、Microsoft、NVIDIA等12家,累计投入1.04亿美元)推出CJS(Cyber Jailbreak Severity)框架,用能力增益、能力广度、武器化难度、可发现性四把尺子打分(0-10分,映射CJS-0到CJS-4五级)给越狱行为定罪。分数只能上调不能下调,并随历史切片动态变化(如Log4Shell在2021年引爆前夜为CJS-4,今天为CJS-0)。
按新框架回看,导致Fable 5下架的那次越狱弱模型也能复刻,能力增益为0,应判为CJS-0"信息性"事件——按新标准本无需下架。但CJS目前仍是早期草案,且Anthropic既是规则制定者也是最大受益者,引发标准话语权之争。
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11