阿德莱德大学提出 DCSD:解耦信用方向与幅度,11 项基准领先 GRPO
AdelaideUniversity · hf · 2026-09-30
阿德莱德大学团队发布新方法 Decoupled Credit Self-Distillation(DCSD),针对自蒸馏中教师监督导致「步级信用方向」与「贡献幅度」耦合的问题。
- 问题:RLVR 提供可靠的轨迹级信用,OPSD 提供密集的 token 级监督,但两者结合时方向与幅度同受教师误判和偏好方差影响。
- 方法:用 belief-margin probing 确定信用方向,用边际信息增益量化信用幅度,实现步级到 token 级的信用分配。
- 结果:在 11 项基准上整体优于 GRPO、OPSD、RLSD、RLCSD;相比基础模型,数学推理提升 8.45 分、多模态推理提升 7.01 分,并修正了 6% token 的信用方向、将 token 信用幅度压缩 1.5 倍。
「研究」频道最新
- 0.6B 小模型替换规则清洗栈,预训练 DCLM 分数提升 4.7% — XiongChenyan · 2026-09-30
- 微软研究:六个主流 LLM 编程时也存在达克效应式自信偏差 — burkov · 2026-09-30
- PixAI 发布动漫基础模型 Tsubaki.3,开源 Tagger 并发布技术报告 — Level-Ninja-2492 · 2026-09-30
- Lean 之父 de Moura 谈 AI 证明:绿勾也会骗人,Collatz 事件暴露内核漏洞 — Machine Learning Street Talk · 2026-09-30
- 论文 LLM-42 登 SOSP 2026:验证式投机让 LLM 推理确定性几乎零开销 — tianyin_xu · 2026-09-30
- 前沿模型能力全是锯齿:平均分第一也不代表能随便换用 — vsikka · 2026-09-30