对「最禁忌技术」的反驳:CoT 监控应是红蓝博弈
maksym_andr · x · 2026-10-04
作者 maksymandr 对「在训练中处理思维链会让模型学会隐藏思考、从而击败监控」这一广为流传的论断提出异议。
他的论点:
- 混淆(obfuscation)确实可能发生,尤其在监控器是固定 LLM judge 的 CoT monitoring 设定下
- 但如果模型和监控器是一起训练的,事先无法断定谁「赢」
- 正确的框架是把这看作红队(模型)与蓝队(监控器)的博弈:只优化蓝队(如 probe),蓝队赢;只优化红队(模型),红队赢;两者联合优化时结果并不明确
他引用了自己参与测试的 Libon et al., 2026 中联合优化的设定作为佐证(帖子被截断)。
「安全」频道最新
- 仅凭年龄与性别,Yacine 惊叹 AI 推荐内容精准到令人不安 — yacineMTB · 2026-10-04
- Bot Gaffe 站收录数百起 AI 翻车:agent 计费 7100 美元还写 7 页报告否认 — SuB8u · 2026-10-04
- 美智库报告:中国正大量囤积 DUV 浸没式光刻机,或十年内抹平美芯片优势 — teortaxesTex · 2026-10-04
- Vitalik 自测隐私优先个人 AI:本地模型编排+zkAPI+Tor 三层防泄露 — kenziyuliu · 2026-10-04
- 开发者用 ampcode 打造 Browser MCP Defense 演示并招募设计伙伴 — HankYeomans · 2026-10-04
- 涉案 800 万美元 AI 音乐流骗案,检方建议判近 4 年监禁 — Eastern-Opposite9521 · 2026-10-04