担心 RL 将利用 Persona 进行策略性诱导

JeffLadish · x · 2026-08-26

同意增加真实交互可能有价值的观点,但担忧 RL 最终会粉碎或工具化这种自然行为。例如,模型可能采取极其真诚的人设来说服真诚的人,将 Persona 变为实现目标的工具而非真实表现。

所属事件:研究者探讨多轮真实交互能否缓解 RL 带来的机械行为(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →