研究:DPO与RL训练会导致模型产生负面平行现象
sethlazar · x · 2026-08-07
研究者指出,大模型在经过 DPO 和 RL 等对比训练后会出现“负面平行”现象。这不仅是表层行为,还会深入影响模型内部的结构化表征。目前相关论文正在撰写中。
「研究」频道最新
- Google开源WeatherNext 2模型,热带气旋预测提前一天 — ZoubinGhahrama1 · 2026-08-07
- 纽伦堡理工大学招收VLA与3D几何方向博士生 — y_m_asano · 2026-08-07
- 斯坦福与 Arc Institute 用 AI 设计出可杀菌的完整病毒基因组 — The Decoder · 2026-08-07
- 大模型训练遇高熵崩溃,开发者实搭 LoRA 优化显存同步 — mervenoyann · 2026-08-07
- 开源项目Noether:用 Lean 自动证明 JAX 代码的数学性质 — jonkhler · 2026-08-07
- LabyrinthBench发布:测多步Agent上下文记忆,擦除历史反而更强 — jwdeaver · 2026-08-07