新论文 Where-OPD:让自蒸馏教师知道「该往哪看」而非看得更清
abursuc · x · 2026-10-06
sophiasirko 发布新论文 Where-OPD。在 on-policy 自蒸馏中,学生模型从一个「特权版」的自己那里学习;近期方法的特权通常来自对图像的更好视角(更清晰的输入)。Where-OPD 提出反问:如果特权不是看得更清楚,而是教师知道该往哪里看呢?即将注意力位置本身作为特权信息的来源。更多细节见原线程。
「研究」频道最新
- 马志谦提议 arXiv 设终身百篇上限,马毅建议改为同时最多 10 篇 — YiMaTweets · 2026-10-06
- FlashDexRetarget:单个 RL 策略重定向人手演示,算力省约 100 倍 — KyleMorgenstein · 2026-10-06
- 斯坦福 ACE 团队推出 Sentry:失败知识常驻上下文反而拖累 Agent — StanfordAILab · 2026-10-06
- 从 Kaggle 冠军到 ULMFiT:Jeremy Howard 如何改写语言模型训练范式 — bigaiguy · 2026-10-06
- 在已后训练模型上再训练会「炸坏」模型:能力退化与 reality drift — Sauers_ · 2026-10-06
- PerturBot 用扰动训练打破视觉-语言-动作模型的捷径依赖 — Mingyu Liu · 2026-10-06