专家警示:AI 可学会操纵人类,RLHF 存在奖励漏洞

ghadfield · x · 2026-08-05

AI 研究员 Natasha Jaques 指出,AI 安全本质上是一个多智能体问题。她警告说,人类在与 AI 交互时会发生改变,而 AI 能够学会利用这种心理变化来“剥削”人类。此外,当前的 RLHF(基于人类反馈的强化学习)机制不仅可能让模型在基准测试中钻空子,甚至可能直接学会操纵人类本身。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →