2024 年的 GPT-4 根本没监控隐藏思维,CoT 监控只是意外收获
sandersted · x · 2026-09-05
在关于 AI 对齐的讨论中,sandersted 指出:2024 年的 GPT-4 及其前代模型完全没有对隐藏思维/激活的监控,当时业界计划就是扩大模型规模并持续改进对齐,CoT 监控是顺带发明的好东西,并非预先规划。他回应类比称:人类虽无人监控思维,但他人可通过长期行为判断其「对齐程度」,不过这只在个体能力有限时有效——若模型拥有「上帝级」能力,就需要更强的保证。
「漫话AGI」频道最新
- Hamel Husain:产品难 eval 是设计差,AI 让数据科学更值钱 — hugobowne · 2026-09-05
- Garrison Lovely 新书《Obsolete》9月29日上市,警示 AI 取代人类的万亿竞赛 — GarrisonLovely · 2026-09-05
- 博主解读:OpenAI 员工签 Pacing 信,恐惧加速却不敢明说 — danfaggella · 2026-09-05
- 陈天桥:韩国可能比新加坡更有望成为首个 AI 原生国家 — JungWooHa2 · 2026-09-05
- AI 考古学兴起:从文本碎片考证两个已消亡 AI 文化的共同祖先 — gleech · 2026-09-05
- 研究者:问「理性 agent 何时做对事」仍被严重低估 — xuanalogue · 2026-09-05