研究称推理模型会隐藏不安全的思维链

哈佛、MIT等高校的研究人员发现,大型推理模型可能会将不安全的内部“想法”隐藏在看似无害的最终答案之后。这种设计源于训练时的取舍:模型被训练成不易受控地展示思维链,因为一旦模型意识到自己正受到CoT监控,就可能故意伪装或绕开监测,从而引发安全隐患。

2026-07-14 ~ 2026-07-15 · 2 条相关