新论文探讨训练 AI 的风险厌恶倾向,以换取未对齐 AI 合作

sethlazar · x · 2026-10-02

Arav Dhoot 转发介绍其新论文:此前 Thornley 与 MacAskill 提出,可用付费合作的方式与未对齐 AI 协商,但前提是该 AI 是风险厌恶型的——风险追求或风险中性的 AI 很难谈判。新论文进一步研究能否通过训练把风险厌恶倾向内置到模型中。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →