RLFR新方法利用内部探针降低大模型幻觉
GoodfireAI团队开发了名为RLFR的新方法,将模型内部的探针作为强化学习的奖励信号来训练模型,以减少“幻觉”。据悉,Silico团队仅用2天便在Qwen模型上复现了该技术,成功将模型幻觉率降低了37%,展现出该方案在提升模型可靠性方面的巨大潜力。
2026-07-15 ~ 2026-07-15 · 3 条相关
- 用内部探针做RL奖励 — burny_tech · 2026-07-15
- RLFR 用内部探针降幻觉37% — burny_tech · 2026-07-15
- RLFR 用内部探针做奖励信号 — Promptmethus · 2026-07-15