模型行为终可解释?interp 工具加 agent 让黑箱问题有完整答案

burny_tech · x · 2026-09-05

Dan Balsam 在讨论中提出观点:对于「模型为什么这么做」「怎么阻止它那么做」这类任意问题,借助越来越强的可解释性(interp)工具以及越来越擅长使用这些工具的 agent,可以获得有意义且相当完整的答案。他认为模型本质上就是程序,正如没人能同时在脑中装下一个庞大代码库的每一行,但这不代表问题的答案不可知。这是对「模型黑箱不可解释论」的一个有力反驳。

所属事件:可解释性工具加 agent 或让模型黑箱问题有完整答案(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →