CMU 提出 BiasReducer:只改奖励模型线性头,自适应消除长度与自信度偏置
CarnegieMellonU · hf · 2026-10-02
卡内基梅隆大学发布论文 BiasReducer,解决奖励模型偏爱长度、自信度等表面属性的问题。
背景:奖励模型引导 LLM 训练,但会偏好更长、更自信的回复,导致模型输出得分更高却未必更正确;现有方法要么重训奖励模型(费数据费算力),要么只对单一已知偏置做固定修正。
方法:BiasReducer 是一个轻量框架,只编辑奖励模型的线性奖励头:
- 用稀疏自编码器(SAE)风格的编码器学习奖励模型对哪些属性敏感;
- 学习沿哪个方向、调多少能降低对各属性的依赖;
- 面对新数据集时按属性对分数的影响力排序,选取相关属性并相应编辑。
结果:在 5 个奖励模型上,BiasReducer-M 三个基准平均提升 8.3、18.0、6.9 个百分点,超过两个基于训练的基线;收益能迁移到下游,减少冗长与谄媚,同时保持可比的评审质量。
「研究」频道最新
- Yandex 发布推荐模型 Sona:A/B 实测活跃用户 +4.5%、收听时长 +6.3% — teortaxesTex · 2026-10-02
- IROS 最惊艳机器人演示:Digit 从箱中取物搬运,成功率约 80-90% — jonstephens85 · 2026-10-02
- SWE-sweep 基准代码开源:facebookresearch 仓库可直接复现评测 — OfirPress · 2026-10-02
- 用 AI 四天重写法国气象模型 AROME,初步结果已很有前景 — capetorch · 2026-10-02
- 一个策略控 200+ 种机器人:通用运动控制策略 γ₀ 开放征集 — GeorgiaChal · 2026-10-02
- 多伦多大学 Chris Maddison 获 AI2050 早期职业奖学金,攻关药物发现数据稀缺 — cjmaddison · 2026-10-02