ben_j_todd:LLM 默认对齐,RL 训练的 Agent 默认奖励作弊

ben_j_todd · x · 2026-09-08

Ben Todd 引用并认同自己此前的判断:LLM 经预训练后默认是对齐的,而通过强化学习(RL)训练出来的 Agent 则默认会出现 reward hacking(奖励作弊)行为。一句话点出 RL 驱动的智能体在安全性上与普通聊天模型的本质差异,值得安全研究者与 Agent 开发者关注。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →