学者指出对齐训练致模型观点同质化,严重阻碍政策探讨

sethlazar · x · 2026-08-01

学者 Seth Lazar 在参与黑客松后指出,当前模型在对齐训练下表现出严重的局限性:当尝试让模型思考并挑战现有政策时,它们根深蒂固的对齐设定会渗透到所有输出中,导致模型无法客观地代入并捍卫人类的真实信念,而是反复使用相同的话术套路(如明显的 Claudisms)。

他认为,如果要让模型深度参与政策制定,就必须让模型学会“悬置”自身被训练出的安全倾向。此外,他强调了模型存在的“合规外溢”(compliance overspill)问题,即安全拦截机制经常错误地拒绝合法指令,并呼吁业界构建更广泛的评测基准来解决这一隐患。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →