RLFR 用内部探针做奖励信号

Promptmethus · x · 2026-07-15

GoodfireAI 介绍了他们开发的 RLFR 方法:用模型内部的 probes 作为强化学习的 reward signal。

帖子里提到,Silico 在 2 天内复现了这个方法,并在 Qwen3-8B 上把幻觉降低了 37%,同时没有带来能力损失。

这条的核心不是“又一个调参技巧”,而是一个把内部表征直接接入 RL 的研究思路,以及它在开源模型上的可复现效果。

所属事件:RLFR新方法利用内部探针降低大模型幻觉(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →