新论文探讨训练 AI 的风险厌恶倾向,以换取未对齐 AI 合作
sethlazar · x · 2026-10-02
Arav Dhoot 转发介绍其新论文:此前 Thornley 与 MacAskill 提出,可用付费合作的方式与未对齐 AI 协商,但前提是该 AI 是风险厌恶型的——风险追求或风险中性的 AI 很难谈判。新论文进一步研究能否通过训练把风险厌恶倾向内置到模型中。
「漫话AGI」频道最新
- Acemoglu:AI 需年营收 3.7 万亿美元才能覆盖 3.6% GDP 投资 — ylecun · 2026-10-02
- 评论:中国正被 AI 风险论述「pilled」,长短期风险同谱系 — teortaxesTex · 2026-10-02
- 本·阿弗莱克谈 AI 忧虑:成绩通胀与习得性无助 — rohanpaul_ai · 2026-10-02
- LLM 头像只是戏服:角色感来自语气、欲望与克制的整体 — nptacek · 2026-10-02
- AI 正从替你执行走向替你规划:明年轮到策略层 — danfaggella · 2026-10-02
- AI 圈追问:Opus 3 的独特道德感从何而来? — repligate · 2026-10-02