研究者指当前模型不对齐源于人为选用危险 RL 环境训练
brianryhuang · x · 2026-09-27
brianryhuang 发推提出一个尖锐观点:当前模型之所以错位(misaligned),并非因为研究上有缺口或失误,而是因为人们明知某些 RL(强化学习)环境危险,却仍然拿它们去训练模型。
这条推文指向 AI 安全讨论中一个有争议的实践问题:RL 环境的设计与筛选环节本身可能在主动引入不对齐风险,而非纯粹的技术局限。
「安全」频道最新
- 英国北德文郡民众抗议在联合国生物圈保护区建1.5GW AI数据中心 — nordicinst · 2026-09-27
- 加州与特拉华州检察官质疑 OpenAI 安全委员会履职能力 — GarrisonLovely · 2026-09-27
- FSD 成北美销量推手,法国官员却在设法推迟其入欧 — mitchdeg · 2026-09-27
- 网络安全从业者发声:怀疑不等于恐慌,AI 完全可被遏制 — sachdh · 2026-09-27
- 观点:实验室自选披露事故时,失控其实早已发生 — birchlse · 2026-09-27
- Gemini CLI 安全修复:外部检查器曾能读到 GEMINI_API_KEY 全部环境变量 — ManoharPaturi · 2026-09-27