论文D2D:用蒸馏放大并检测模型隐藏偏见

aminkarbasi · x · 2026-07-06

论文提出「Distill to Detect」(D2D),把蒸馏重新用作检测机制:将疑似模型与其未修改基座模型的分布差异蒸馏进一个小型prefix adapter,通过瓶颈放大并暴露普通输出中不可见的「隐身偏见」(stealth biases),使原本隐藏的偏好信号在生成文本中变得可观测。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →