用内部探针做RL奖励
burny_tech · x · 2026-07-15
GoodfireAI 介绍了他们开发的 RLFR:把模型内部的 probe 作为强化学习的奖励信号,用来训练模型更少胡说。
转发里提到,Silico 在 2 天内复现了这个方法,并声称在 Qwen3-8B 上把幻觉率降低了 37%,同时没有造成能力损失。
所属事件:RLFR新方法利用内部探针降低大模型幻觉(3 条相关)→
「研究」频道最新
- 可编程元胞自动机 PCA:让每条规则变成可读代码 — Amidos2006 · 2026-09-11
- GEVIBench 发布:系统对比各类电压指示器的综合基准 — drmichaellevin · 2026-09-11
- 高斯混合建模光传输方程,INRIA 新方法加速全局光照求解 — ssh4net · 2026-09-11
- Goodfire 解读可解释性:海贼语数学模型如何只学数学不学海盗腔 — Machine Learning Street Talk · 2026-09-11
- P vs NP 恐难被 AI 攻破,fortnow 点名 NP vs L 等更可行难题 — fortnow · 2026-09-11
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11