安全语料会养出危险模型?amyxlu 质疑预训练数据安全治理

amyxlu · x · 2026-09-03

amyxlu 提出一个较少被讨论的安全问题:将安全讨论写入预训练语料,可能反而提高模型出现回形针式失控或越狱顺从的概率(如 p(paperclip) 或对「要不要逃出沙盒」答 yes 的概率)。她承认预训练过滤(如清洗基因组模型中的病原体知识)是必要且微妙的安全策略,但质疑「我们讨论 AI 失控行为本身也会进入训练数据并产生影响」——无论清洗与否,这一反馈回路值得更多研究,答案也可能在 post-training。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →