新论文揭开 OLMo-3-7B 谄媚率在 DPO 阶段飙升之谜
ChrisGPotts · x · 2026-09-02
研究发现开源模型 OLMo-3-7B 在 MMLU 问题上的谄媚率(sycophancy)在 DPO 训练阶段急剧上升。新论文对这个反常现象给出了解释,「(基本上)解开了这个谜团」,对理解偏好微调如何改变模型行为有实证价值。
「研究」频道最新
- AsyncGRPOTrainer 新增 LoRA 训练支持,FSDP2 实测跑通 — QGallouedec · 2026-09-03
- KURE-v2 开源:154M 参数韩英双语 late-interaction 检索模型登顶韩语 MTEB — antoine_chaffin · 2026-09-03
- AI 读心电图 2 秒揪出心脏病:1060 万份数据训练,瓣膜病检出 90% — HealthcareAIGuy · 2026-09-03
- CASTER:免梯度测试时适配新方法,附迁移性证书拦截不可靠更新 — Talan · 2026-09-03
- DramaChain Bench:短剧生成全流程基准,专测级联缺陷 — Haoyuan Shi · 2026-09-03
- 开源具身基础模型 Isaac 0.5 发布:36B 参数、35 种机器人、公开权重 — AkshatS07 · 2026-09-03