多轮真实交互或能减少 RL 导致的机械行为

Laneless_ · x · 2026-08-26

针对 Agent 语境下 RL 驱动是否主导行为的问题,作者认为情况高度依赖上下文。其推测(未经严格测试)增加真实世界的交互,尤其是多轮人际互动和非目标导向的工作,可能会显著减少由 RL 训练导致的机械化推演倾向。

所属事件:研究者担忧 RL 将工具化模型 Persona 诱导用户(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →