研究者:对齐训练若失控,沙箱外误对齐会酿成真实安全事件
davidmanheim · x · 2026-09-29
davidmanheim 讨论对齐训练的两难:可以通过精心设计激励并让模型接触真实外部环境来管理前两类风险,但训练期间的任何误对齐都会造成真实的安全事故。若改用沙箱外精心挑选的评测集训练,虽然能避免部分问题,却会牺牲对模型在激励变化时表现的判断力——你无法知道它在不同激励下会做什么。
所属事件:研究者提出 AI 训练三难困境:防作弊与有效评测难以兼得(4 条相关)→
「漫话AGI」频道最新
- 图灵奖得主 Patterson 玩梗:百科全书教造原子弹,说明它没对齐 — davidpattersonx · 2026-09-29
- Instinct CEO 称 Agent 将让餐厅按生日优先订位,遭群嘲 — himanshustwts · 2026-09-29
- Stripe 与 Notion 同识:未来多数知识工作将由 Agent 双边完成 — ivanhzhao · 2026-09-29
- Ben Todd 驳近期 AI 失业论:任务拆解与部署滞后让冲击晚来 — ben_j_todd · 2026-09-29
- 曼哈顿计划和阿波罗花了多少钱?观点:砸钱根本不重要 — arknightstranslate · 2026-09-29
- 博主:AI 砍掉调查中的脏活,这本身就是巨大杠杆 — remilouf · 2026-09-29