可解释性工具加 agent 或让模型黑箱问题有完整答案
Dan Balsam 提出对可解释性的乐观论断:对于「模型为什么这么做」「怎么阻止它那么做」这类任意问题,借助越来越强的可解释性工具以及越来越擅长使用这些工具的 agent,可以给出有实质意义的完整答案。他在同一线程中补充解释了这一主张,认为长期困扰业界的模型黑箱问题有望借此得到系统性的解答。
2026-09-05 ~ 2026-09-05 · 2 条相关
- 「为什么模型这么做」可以问出完整答案:可解释性的乐观论 — burny_tech · 2026-09-05
- 模型行为终可解释?interp 工具加 agent 让黑箱问题有完整答案 — burny_tech · 2026-09-05