论文D2D:用蒸馏放大并检测模型隐藏偏见
aminkarbasi · x · 2026-07-06
论文提出「Distill to Detect」(D2D),把蒸馏重新用作检测机制:将疑似模型与其未修改基座模型的分布差异蒸馏进一个小型prefix adapter,通过瓶颈放大并暴露普通输出中不可见的「隐身偏见」(stealth biases),使原本隐藏的偏好信号在生成文本中变得可观测。
「研究」频道最新
- researchers 辩论双向注意力:检索微调放大后因果性或可舍弃 — antoine_chaffin · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11