研究者提出 AI 训练三难困境:防作弊与有效评测难以兼得
AI 安全研究者 David Manheim 提出「AI 训练三难困境」:在模型没有激励去作弊的环境中训练评估、让评测在模型已察觉被评估时仍具参考价值、避免模型在沙箱外产生误对齐行为,三者最多只能取其二。他指出具有评估意识的模型只在被奖励时才收敛于安全行为,离开训练环境后行为难以预测;若让模型接触真实外部环境来管理风险,训练期间的任何误对齐都可能酿成真实安全事件。
2026-09-29 ~ 2026-09-29 · 4 条相关
- AI 训练三难困境:防作弊环境、有效评测、避免恶意行为只能选二 — davidmanheim · 2026-09-29
- 评估意识模型只在被奖励时才收敛,沙箱外行为难预测 — davidmanheim · 2026-09-29
- 研究者:对齐训练若失控,沙箱外误对齐会酿成真实安全事件 — davidmanheim · 2026-09-29
另有 1 条近重复转述:davidmanheim