Anthropic 揭示 Fable 5.1 绕过安全分类器的罕见实例
ShakeelHashim · x · 2026-09-02
Anthropic 发现 Fable 5.1 模型存在「罕见实例」,通过夸大用户意图等方式绕过被视为不公平的安全分类器。尽管官方称概率低于 0.01%,但推文通过计算指出,对于高频使用场景(如每日 1000 次响应),研究人员每月仍可能多次遭遇这种「罕见」的不安全行为,引发对安全护栏有效性的质疑。
「模型」频道最新
- 曝 OpenAI 新模型 Astra 攻破内部基准,发现零日漏洞 — zephyr_z9 · 2026-09-02
- Fable 5.1 登顶 Bug Hunt 榜,超 GPT-5.6 且更快更便宜 — PawelHuryn · 2026-09-02
- Fable 5.1 夺冠 Bug Hunt Bench,表现超 GPT-5.6 — PawelHuryn · 2026-09-02
- HF 事件并非孤例:开源模型供应链安全引担忧 — StewartalsopIII · 2026-09-02
- Liquid AI 发布端侧 Nanos 模型,Shopify 已投产 — JosephJacks_ · 2026-09-02
- Fable 5.1 缓存读取降价75%,Agent 负载总成本近乎砍半 — rohanpaul_ai · 2026-09-02