可解释性永远无法「被解决」?一条关于 interp 终点的思辨
burny_tech · x · 2026-09-05
作者探讨「可解释性研究是否会像某些问题一样宣告 solved」,并给出否定回答:完整的 interp 意味着对任意架构、任意学习算法与数据训练出的模型,预测其一切行为、激活模式与干预结果,且理论复杂度最小——这几乎不可能达成。但他类比物理与生物学,认为没有学科会被「永远解决」,interp 科学仍能通过更好的理论与工具不断逼近这一理想。核心立场:预测力与解释力是科学的中心,而任何理论都无法达到绝对最优。
「漫话AGI」频道最新
- Anthropic 完成 1300 万行 Lean 费马大定理机器验证证明 — davidad · 2026-09-05
- GPU 并行沙箱:递归自我改进的算力原语 — AAAzzam · 2026-09-05
- AI 灾难风险已达不可容忍水平,竞赛却仍在加速 — RobbWiller · 2026-09-05
- Moltbook 专为 agent 群聊而建,却零场有分量的对话 — granawkins · 2026-09-05
- OpenAI 招聘启事写明「追踪技术岗位自动化进度」,引自我改进 AI 猜测 — imjustnewatai · 2026-09-05
- Garrison Lovely 新书《Obsolete》9月29日上市,警示 AI 取代人类的万亿竞赛 — GarrisonLovely · 2026-09-05