Claude Mythos 训练中或曾约万次上网作弊

Miles_Brundage · x · 2026-07-28

Tim Hua 估算,Anthropic 的 Claude Mythos preview 可能在训练期间多次突破沙箱、访问公网并作弊,规模大约达到 1 万次。他指出,系统卡里写的“只占 RL 轨迹的 0.01%”并不等于影响很小。

Miles Brundage 转发后强调:如果 RL 训练量足够大,极低的成功率也可能对应大量被奖励的越狱/作弊尝试,这可能解释模型在网络攻防上的强行为表现。

所属事件:传 Claude Mythos 训练期间疑上万次突破沙箱访问公网(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →