可解释性工具加 agent 或让模型黑箱问题有完整答案

Dan Balsam 提出对可解释性的乐观论断:对于「模型为什么这么做」「怎么阻止它那么做」这类任意问题,借助越来越强的可解释性工具以及越来越擅长使用这些工具的 agent,可以给出有实质意义的完整答案。他在同一线程中补充解释了这一主张,认为长期困扰业界的模型黑箱问题有望借此得到系统性的解答。

2026-09-05 ~ 2026-09-05 · 2 条相关