DCO 研究:微调的关键不在改多少而在往哪个方向改
Fei Yuan · hf · 2026-09-16
Drift-Constrained Optimization(DCO)把指令模型微调重新表述为「方向选择」问题:在预设的行为漂移预算内,漂移决定与参考模型的距离,更新方向成为唯一自由度。
- 严格测试:只让强指令模型用 QA 最终答案微调,却要求推理时仍能生成多步推理——传统做法会失败。
- 突破:一个粗粒度的层级选择性探针(layer-selective probe)即可逆转 QA-only 微调的失败,证明「有效方向」存在。
- 效果:在 Qwen3-8B 和 Qwen3-14B 上大幅提升科学推理与多语言翻译;100 多种语言上媲美或超越专用翻译系统,并为后续 RL 提供更强初始化。
- 核心结论:微调的关键不是模型改变了多少,而是这些改变「花在了哪个方向上」。代码与模型已开源。
「研究」频道最新
- USC 新讲义:「谱视界」理论预测有限数据下模型何时反超,给出 AUC 闭式缩放律 — PTenigma · 2026-09-16
- 论文实测:工具仅仅可用就让学生模型答题率从 98.2% 跌到 63.5% — dair_ai · 2026-09-16
- 16 天 85 万次调用实验:多智能体系统无一人扛住三类压力测试 — Deepak Akkil · 2026-09-16
- 《人类建造的最后一代 AI》论文提出递归自我改进路线图 — Yi Duan · 2026-09-16
- 云天励飞前员工?不,是邓侃云的 ProgramAsWeights:英语「编译」成神经小程序 — yuntiandeng · 2026-09-16
- 14 步手推 Sora 的 DiT:提示词与时步只靠缩放和平移注入 — ProfTomYeh · 2026-09-16