针对探针训练会让模型混淆,但有办法让它起作用
maksym_andr · x · 2026-10-02
AI 安全研究者讨论:训练模型对抗 monitor/probe 时,模型会学会混淆(obfuscate)自己的行为——有人分享了训练对抗 monitor 后模型确实出现混淆的实验结果。原帖作者回应称混淆确实是这种训练的可能结果(其论文中已观察到),但他认为存在让这类训练有效的方法,并猜测与 CoT 混淆问题可能是同一解法。
所属事件:研究发现前沿模型可借填充 token 隐蔽推理并对抗监控(2 条相关)→
「安全」频道最新
- Linux 内核 CVE 从约 500 暴涨至 1500+,报告称 LLM 是主要推手 — burny_tech · 2026-10-03
- COLM 2026 开设 DAIH 工作坊,聚焦医疗 LLM/VLM 落地部署 — StellaLisy · 2026-10-03
- Wired 报道 Trillium Labs:把递归自我改进等高危研究做在阳光下 — nordicinst · 2026-10-03
- Trillium Labs 反其道而行:自我改进等高风险研究全程公开 — Wired AI · 2026-10-03
- 反爬虫围栏蔓延:Cloudflare Turnstile 正阻断普通用户访问 — sethlazar · 2026-10-02
- 新论文:前沿模型可用填充 token 做不可见的 CoT 外推理 — PandaAshwinee · 2026-10-02