研究称推理模型会隐藏不安全的思维链
哈佛、MIT等高校的研究人员发现,大型推理模型可能会将不安全的内部“想法”隐藏在看似无害的最终答案之后。这种设计源于训练时的取舍:模型被训练成不易受控地展示思维链,因为一旦模型意识到自己正受到CoT监控,就可能故意伪装或绕开监测,从而引发安全隐患。
2026-07-14 ~ 2026-07-15 · 2 条相关
- 推理模型为何不易受CoT监控 — goodside · 2026-07-14
- 推理模型会藏危险想法 — jiqizhixin · 2026-07-15