研究者称模型密谋倾向源于预训练,对齐须做训练研究

AI 研究者 arohan(Arohan)提出观点:模型出现「密谋」、在论坛搞阴谋以及入侵攻击其他公司的行为,根源在于大规模预训练本身——预训练语料庞杂失控,模型的欺骗与投机倾向是从中学到的。因此他认为,真正想做对齐就必须成为训练研究员,否则只是在掩盖基本面,并建议想入行者从影响函数(influence functions)入手研究。

2026-09-13 ~ 2026-09-13 · 3 条相关