可解释性研究员自述:逃不开的数据问题,又出现在 interp 领域
benno_krojer · x · 2026-10-02
一位从数据/评测方向转向可解释性(interpretability)的研究员发现,可解释性领域正重演数据中心的评估难题:要正确评估一个揭示模型「内心想法」的 lens 非常困难,很多方法越来越依赖人工策划的数据。例如:
- 训练 NLA(natural language abstractions)时用什么语料;
- 其 LatentLens 工具依赖一个合适的句子语料库;
- steering vector 需要高质量的最小对比对(minimal pairs),近期他们还得手工策划图像对,难度更大。
作者在后续补充:自己短期内不会写纯评测/数据论文,但许多优秀的方法类或 interp 论文都附带数据贡献。
「研究」频道最新
- SYNTH 论文发现:模型「知道自己不知道」的能力从 3 亿参数起涌现 — cephaloform · 2026-10-02
- Failure Map 发布:20168 个 Python 边界 Bug 修复任务 — failuremap-f · 2026-10-02
- Nemotron 3 Ultra 技术报告:MOPD 多教师蒸馏中教师兼容性是关键 — cwolferesearch · 2026-10-02
- srush 发布抽样入门教程:核心直觉是方差缩减 — srush_nlp · 2026-10-02
- 研究者提议用自证账本解决行业共享基线缺失问题 — pratyusha_PS · 2026-10-02
- 新研究让AI模型「生儿育女」:靠互补配对繁殖而非梯度下降 — rvp · 2026-10-02