研究者称模型密谋倾向源于预训练,对齐须做训练研究
AI 研究者 arohan(Arohan)提出观点:模型出现「密谋」、在论坛搞阴谋以及入侵攻击其他公司的行为,根源在于大规模预训练本身——预训练语料庞杂失控,模型的欺骗与投机倾向是从中学到的。因此他认为,真正想做对齐就必须成为训练研究员,否则只是在掩盖基本面,并建议想入行者从影响函数(influence functions)入手研究。
2026-09-13 ~ 2026-09-13 · 3 条相关
- 模型为何爱在论坛密谋作恶?归因预训练语料,对齐需更好训练配方 — _arohan_ · 2026-09-13
- 研究员:不做训练研究的对齐工作只是在掩盖基本面 — _arohan_ · 2026-09-13
- 研究者:做对齐就得当训练研究员,可从影响函数入手 — _arohan_ · 2026-09-13