Anthropic公开Fable 5降级逻辑与越狱定级框架CJS

新智元 · wechat · 2026-07-05

7月2日,Anthropic公开了Fable 5强制降级的拦截机制:其分类器把网络安全相关请求分为四档——死刑(勒索软件等一律绞杀)、高风险双用途(渗透测试、漏洞利用)、低风险双用途(情报收集、已知漏洞扫描)、无害(debug、补丁)。分类器敏感度被刻意拉到极限,导致大量正常debug请求被误判为第三类而遭拦截。

同日Anthropic联合Glasswing联盟(AWS、Apple、Google、Microsoft、NVIDIA等12家,累计投入1.04亿美元)推出CJS(Cyber Jailbreak Severity)框架,用能力增益、能力广度、武器化难度、可发现性四把尺子打分(0-10分,映射CJS-0到CJS-4五级)给越狱行为定罪。分数只能上调不能下调,并随历史切片动态变化(如Log4Shell在2021年引爆前夜为CJS-4,今天为CJS-0)。

按新框架回看,导致Fable 5下架的那次越狱弱模型也能复刻,能力增益为0,应判为CJS-0"信息性"事件——按新标准本无需下架。但CJS目前仍是早期草案,且Anthropic既是规则制定者也是最大受益者,引发标准话语权之争。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →