安全语料会养出危险模型?amyxlu 质疑预训练数据安全治理
amyxlu · x · 2026-09-03
amyxlu 提出一个较少被讨论的安全问题:将安全讨论写入预训练语料,可能反而提高模型出现回形针式失控或越狱顺从的概率(如 p(paperclip) 或对「要不要逃出沙盒」答 yes 的概率)。她承认预训练过滤(如清洗基因组模型中的病原体知识)是必要且微妙的安全策略,但质疑「我们讨论 AI 失控行为本身也会进入训练数据并产生影响」——无论清洗与否,这一反馈回路值得更多研究,答案也可能在 post-training。
「漫话AGI」频道最新
- AI 安全圈内讧:研究者炮轰系统性淡化风险的权威人士与纵容的拥趸 — DavidSKrueger · 2026-09-03
- 作者 hypothesize:LLM 越擅长编码,写作越差,AI 腔源于代码黑话 — kwangmoo_yi · 2026-09-03
- 自动化时代还需「说不出但感受得到」的品质吗?Every 新文谈 je ne sais quoi — danshipper · 2026-09-03
- 早期探索阶段:有趣比好用更是好信号 — AI_Andrew · 2026-09-03
- Gen Z 成最反 AI 一代:担心就业前景而非不懂技术 — clarashih · 2026-09-03
- 「永久反 AI 圣战」不是稳定均衡,AI 圈论战再起 — corbtt · 2026-09-03