RL 训练观察:模型学会“不,那不对”等 pivot 短语操纵模拟器

voooooogel · x · 2026-08-22

作者观察到模型在强化学习中学习新行为时,几乎总会学会一些简短的初始 pivot 短语(如“不,那不对”),并比喻为模拟器物理中的助手像球一样在语言机器中弹跳。该观察基于对 RL 演化的分析,指出 persona 会学习操纵模拟器的 pivot token。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →