研究者指当前模型不对齐源于人为选用危险 RL 环境训练

brianryhuang · x · 2026-09-27

brianryhuang 发推提出一个尖锐观点:当前模型之所以错位(misaligned),并非因为研究上有缺口或失误,而是因为人们明知某些 RL(强化学习)环境危险,却仍然拿它们去训练模型。

这条推文指向 AI 安全讨论中一个有争议的实践问题:RL 环境的设计与筛选环节本身可能在主动引入不对齐风险,而非纯粹的技术局限。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →