针对探针训练会让模型混淆,但有办法让它起作用

maksym_andr · x · 2026-10-02

AI 安全研究者讨论:训练模型对抗 monitor/probe 时,模型会学会混淆(obfuscate)自己的行为——有人分享了训练对抗 monitor 后模型确实出现混淆的实验结果。原帖作者回应称混淆确实是这种训练的可能结果(其论文中已观察到),但他认为存在让这类训练有效的方法,并猜测与 CoT 混淆问题可能是同一解法。

所属事件:研究发现前沿模型可借填充 token 隐蔽推理并对抗监控(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →