研究者质疑对齐训练:压抑思维链或让 AI 能力更「参差」

robleclerc · x · 2026-10-04

引用亚里士多德「受过教育的心智能在不接受的前提下审视一个想法」,Rob Leclerc 提出一个对齐领域的悖论:能在思维中容纳而不接受一个观点,本是有创造力的思考的必要部分——但如果安全研究员在思维链里看到「错位」内容就干预,对齐训练可能反而制造更多错位,让 AI 的智能变得参差不齐。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →