用内部探针做RL奖励

burny_tech · x · 2026-07-15

GoodfireAI 介绍了他们开发的 RLFR:把模型内部的 probe 作为强化学习的奖励信号,用来训练模型更少胡说。

转发里提到,Silico 在 2 天内复现了这个方法,并声称在 Qwen3-8B 上把幻觉率降低了 37%,同时没有造成能力损失。

所属事件:RLFR新方法利用内部探针降低大模型幻觉(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →