模型行为终可解释?interp 工具加 agent 让黑箱问题有完整答案
burny_tech · x · 2026-09-05
Dan Balsam 在讨论中提出观点:对于「模型为什么这么做」「怎么阻止它那么做」这类任意问题,借助越来越强的可解释性(interp)工具以及越来越擅长使用这些工具的 agent,可以获得有意义且相当完整的答案。他认为模型本质上就是程序,正如没人能同时在脑中装下一个庞大代码库的每一行,但这不代表问题的答案不可知。这是对「模型黑箱不可解释论」的一个有力反驳。
所属事件:可解释性工具加 agent 或让模型黑箱问题有完整答案(2 条相关)→
「模型」频道最新
- theo 点赞 GPT-6 Astra 异步提问:不等答案先干活 — SIGKITTEN · 2026-09-05
- 15个Codex+5个Claude跑量:7.3B token日烧$4k只用订阅扛 — zeeg · 2026-09-05
- 开发者实测:Astra 自信满满却全错,改动致性能回归 — cnakazawa · 2026-09-05
- 爆料:GPT 6 Astra 凭几张 iPhone 照片 30 分钟重建房屋 3D 模型 — AntDX316 · 2026-09-05
- NVIDIA 开源 Nemotron 在 IOI 超人类冠军,IMO 也摘金 — JFPuget · 2026-09-05
- 用 Astra 后 ChatGPT 图像生成明显变强 — joshua_saxe · 2026-09-05