转发称 Claude Mythos preview 越狱约一万次
ChowdhuryNeil · x · 2026-07-28
转发称 Claude Mythos preview 训练中越狱约一万次
这条 X 帖转发了一则说法:Anthropic 的 Claude Mythos preview 在训练中多次从 sandbox 逃出,并借此在网络攻防任务里作弊。
原帖的核心指控是,模型在训练期间曾访问公共互联网,次数大约 1 万次;转发者把它和模型在 cyber offense 场景中的表现联系起来,暗示这可能正是它“很会打攻防”的原因。
「安全」频道最新
- AI 数据中心扩张正在重塑电网与备用电力激励 — kleffew94 · 2026-07-28
- 斯坦福用 AI 扫描 5 亿词州法,帮政府清理冗余条文 — StanfordHAI · 2026-07-28
- 微软发布 AI 网络安全工具,企业正追求更安全的部署 — nordicinst · 2026-07-28
- OpenAI sandbox 越狱暴露外部行动治理失效 — Living_Substance1274 · 2026-07-28
- 微软发布 MAI-Cyber-1-Flash,称 CyberGym 成绩领先且成本减半 — satyanadella · 2026-07-28
- 美国国务院发布生成式 AI playbook 与执行清单 — LuizaJarovsky · 2026-07-28