关闭安全护栏后 Claude Mythos 5.1 写出可用漏洞 250 试 245 中
rohanpaul_ai · x · 2026-09-02
在安全护栏关闭的测试中,Claude Mythos 5.1 在 250 次 Firefox 漏洞挖掘试验里写出 245 个完全可用的 exploit,成功率 98%,而六个月前的旗舰模型仅 52%。
更关键的发现是「发现 vs 武器化」的区别:模型找 bug 的能力几乎没变,暴涨的是拿到一个 bug 之后把它做成可用攻击的能力。同帖还提到 Fable 5.1 的缓存读取成本比 Fable 5 低 75%,agent 工作负载中缓存反复复用,单组件降价可摊薄到整体约 45% 的成本节省——企业的问题正在变成「agent 能干多久才划不来」。
「模型」频道最新
- 「GPT-6-ASTRA」现已被预置到 OpenAI API,新模型或临近发布 — ThunderBeanage · 2026-09-03
- Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber — Google DeepMind · 2026-09-03
- 同一模型换 harness 成绩差 17 个点,360 次运行实测对比 — stuffyokodraws · 2026-09-03
- 谷歌研究员点赞 Gemini 3.8 Flash:科学能力持续进步 — vivnat · 2026-09-03
- 用户实测称 Fable 5.1 远胜 Opus 5,更倾向把 Opus 当子智能体 — mertdumenci · 2026-09-03
- ARC-AGI-2 榜单易主:Rabbithole 以 73.33% 登顶 — GregKamradt · 2026-09-03