2024 年的 GPT-4 根本没监控隐藏思维,CoT 监控只是意外收获

sandersted · x · 2026-09-05

在关于 AI 对齐的讨论中,sandersted 指出:2024 年的 GPT-4 及其前代模型完全没有对隐藏思维/激活的监控,当时业界计划就是扩大模型规模并持续改进对齐,CoT 监控是顺带发明的好东西,并非预先规划。他回应类比称:人类虽无人监控思维,但他人可通过长期行为判断其「对齐程度」,不过这只在个体能力有限时有效——若模型拥有「上帝级」能力,就需要更强的保证。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →