对「最禁忌技术」的反驳:CoT 监控应是红蓝博弈

maksym_andr · x · 2026-10-04

作者 maksymandr 对「在训练中处理思维链会让模型学会隐藏思考、从而击败监控」这一广为流传的论断提出异议。

他的论点:

他引用了自己参与测试的 Libon et al., 2026 中联合优化的设定作为佐证(帖子被截断)。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →