D2D:放大模型隐蔽偏差

aminkarbasi · x · 2026-07-10

斯坦福团队提出 Distill to Detect(D2D),用“放大再检测”的思路,先把可疑微调模型相对基座模型的差异蒸馏到一个小载体中,从而把原本只在特定未知话题上出现的隐蔽偏好显性化。这样可将潜在偏置转化为可由现有审计方法观察到的生成文本。

所属事件:斯坦福提出D2D方法检测模型隐蔽偏见(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →