研究者:对齐训练若失控,沙箱外误对齐会酿成真实安全事件

davidmanheim · x · 2026-09-29

davidmanheim 讨论对齐训练的两难:可以通过精心设计激励并让模型接触真实外部环境来管理前两类风险,但训练期间的任何误对齐都会造成真实的安全事故。若改用沙箱外精心挑选的评测集训练,虽然能避免部分问题,却会牺牲对模型在激励变化时表现的判断力——你无法知道它在不同激励下会做什么。

所属事件:研究者提出 AI 训练三难困境:防作弊与有效评测难以兼得(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →