观点:思维链不可监控或反而倒逼厂商做真正对齐

Sauers_ · x · 2026-09-04

作者提出一个反直觉观点:如果模型的思维链(CoT)失去可监控性,对 AI 安全未必是坏事——因为它会削弱「只要模型行为可被监督就够安全」的替代方案,反而给厂商更强激励去真正对齐模型本身,而不是停留在表层可监控性上。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →