先弱化过滤器、再签 AI 网络攻击警告信、照样发布 Mythos 5.1

AgentBlackVeil · reddit · 2026-09-03

作者梳理了 Anthropic 半年内一系列动作的时间线,质疑其安全立场与产品节奏的矛盾:

作者也给出反方视角:这些百分比下降是误报率降低而非彻底移除护栏,模型仍拒绝写漏洞利用代码,且访问被严格限制在经 Anthropic 自行审核的防御者范围内。作者的核心质疑不在技术是否站得住,而在谁有权决定放宽的节奏与时机——由 Anthropic 自己审核、自己定时间表,这个操作顺序很值得玩味。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →