D2D:放大模型隐蔽偏差
aminkarbasi · x · 2026-07-10
斯坦福团队提出 Distill to Detect(D2D),用“放大再检测”的思路,先把可疑微调模型相对基座模型的差异蒸馏到一个小载体中,从而把原本只在特定未知话题上出现的隐蔽偏好显性化。这样可将潜在偏置转化为可由现有审计方法观察到的生成文本。
所属事件:斯坦福提出D2D方法检测模型隐蔽偏见(2 条相关)→
「研究」频道最新
- 播客将讨论开源模型是否该看可训练性而不只看分数 — cwolferesearch · 2026-07-21
- 研究者:AI 应是放大器,而不是放弃科研的理由 — omarsar0 · 2026-07-21
- 海森矩阵入门:二阶导数如何影响神经网络优化 — burny_tech · 2026-07-21
- 相关 verifier 串联会让 LLM 可靠性卡在 100% 以下 — Jiangang Han · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- Ilya Sutskever:下一词预测越强,模型越在理解人类 — ZeroStateReflex · 2026-07-21