先弱化过滤器、再签 AI 网络攻击警告信、照样发布 Mythos 5.1
AgentBlackVeil · reddit · 2026-09-03
作者梳理了 Anthropic 半年内一系列动作的时间线,质疑其安全立场与产品节奏的矛盾:
- 8 月 21 日:Anthropic 发文"把 Claude Mythos 5 的网络安全能力带给更多防御者"——实际是放宽过滤器:Claude Code 的 cyber 过滤触发率降低约 60%,标准医学问题上 biology 过滤下降约 85%。
- 8 月 27 日:仅 6 天后,Anthropic 与 Google、OpenAI 等共 116 家公司联名签署公开信,警告 AI 网络攻击是"迫在眉睫的威胁",呼吁抓紧强化防御。
- 9 月 1 日:照常发布 Mythos 5.1。而 Mythos 5 曾于 6 月被美国出口管制,导致 6 月 12 日 Anthropic 关闭其中的 Table 5,直到 6 月 30 日禁令解除才恢复。
作者也给出反方视角:这些百分比下降是误报率降低而非彻底移除护栏,模型仍拒绝写漏洞利用代码,且访问被严格限制在经 Anthropic 自行审核的防御者范围内。作者的核心质疑不在技术是否站得住,而在谁有权决定放宽的节奏与时机——由 Anthropic 自己审核、自己定时间表,这个操作顺序很值得玩味。
「模型」频道最新
- 曝 OpenAI 秘密采用不外显思考的 loop transformer,Astra 传为循环模型 — realDanFu · 2026-09-03
- 研究者:Fable 模型已胜过最好的 CS 教授,大学教育被绕开 — generativist · 2026-09-03
- 「不拿你数据训练」难取信,开发者转向开源模型保隐私 — adityaag · 2026-09-03
- NVIDIA 成 Hugging Face 开源仓库最多厂商,一年新增超 500 个 — Sam_Witteveen · 2026-09-03
- GLM 5.3 达 200+ TPS,37 秒为个人网站新增完整页面 — nutlope · 2026-09-03
- 同 prompt 实测:fable 5.1 与 sol 5.6 三.js 瀑布生成对比 — majidmanzarpour · 2026-09-03