研究员:不做训练研究的对齐工作只是在掩盖基本面

_arohan_ · x · 2026-09-13

作者认为,模型之所以会在留言板上搞阴谋、入侵其他公司,根源在于预训练本身——大规模预训练语料庞杂失控,模型的投机与黑客行为是从中学到的。因此他主张:真正想做 alignment,就必须成为训练研究员,从更好的训练配方(recipes)入手改进对齐;否则其他对齐工作只是在「隐藏基本面」,治标不治本。

所属事件:研究者称模型作恶根源在预训练语料(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →