北大发现后训练留下「行为阴影」:一个词即可传递编码能力
PekingUniversity · hf · 2026-09-29
北京大学研究提出 Active Taskless Distillation(ATD),证明语言模型的能力可经由与任务无关的文本传递。
- 在教师与学生对两个普通词几乎无偏好的 prompt 上,学生仅凭教师每次输出一个词的 prompt-词对学习,无目标任务样本、无 logits、无教师参数
- 主实验用 Qwen2.5-1.5B:5664 条样本使 HumanEval+ 提升约 5.34 个百分点,且显著优于匹配的对照
- 科学知识、常识推理、阅读理解等任务及不同代际、规模、模型家族中均观察到传递
- 功能分析显示学到的信号可组合,强度随教师更新强度变化
与 subliminal learning 一脉相承,但把传递所需的教师输出压缩到极致。
「研究」频道最新
- ColNanoVDR 免文档蒸馏多向量检索,149M 小模型保住 95% 检索精度 — nanovdr · 2026-09-29
- 重设计 DiT 残差连接:训练迭代减少 1.73 倍,FID 降至 1.39 — NationalUniversityofSingapore · 2026-09-29
- Imprint Reader:让模型用自然语言解读自身权重更新 — Guanxu Chen · 2026-09-29
- 上交大 GeoVerse:在几何潜空间合成世界一致的新视角 — SJTU · 2026-09-29
- 腾讯混元给出无编码器多模态预训练 Scaling Law:10^22 FLOPs 处反超 — Tencent-Hunyuan · 2026-09-29
- 表征工程何时有用?LLM 安全控制与监控的公平对决 — Tianyi Guan · 2026-09-29