可解释性永远无法「被解决」?一条关于 interp 终点的思辨

burny_tech · x · 2026-09-05

作者探讨「可解释性研究是否会像某些问题一样宣告 solved」,并给出否定回答:完整的 interp 意味着对任意架构、任意学习算法与数据训练出的模型,预测其一切行为、激活模式与干预结果,且理论复杂度最小——这几乎不可能达成。但他类比物理与生物学,认为没有学科会被「永远解决」,interp 科学仍能通过更好的理论与工具不断逼近这一理想。核心立场:预测力与解释力是科学的中心,而任何理论都无法达到绝对最优。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →