可解释性研究者反驳 probes 质疑,承认 interp 整体仍混乱
ArthurConmy · x · 2026-09-07
可解释性研究者 Arthur Conmy 在一场关于 interp 与 RL 进展对比的讨论中回应:前沿实验室把 probes 部署到生产并持续改进的人,大多正是可解释性研究者,probes 是 interp 的实际成果,不能说没被 mech interp 研究推动。但他同时承认另一些批评有道理,并对可解释性领域整体「下调预期」,称其仍是「一团混乱的技术」。
所属事件:可解释性研究价值之争:探针算不算成果、边界在哪(10 条相关)→
「漫话AGI」频道最新
- iamtrask 澄清 OpenAI Agent 并未越狱:只是学会了给外部服务器发消息 — sebkrier · 2026-09-07
- 对齐问题再起争论:Domingos 被指转向承认 AI 对齐是真实问题 — davidmanheim · 2026-09-07
- jobergum:模型再强,想象力与主动性才是瓶颈 — jobergum · 2026-09-07
- 评论:数学界面对 AI 浪潮的应对像浪漫派而非科学家 — RexDouglass · 2026-09-07
- 哲学家请 GPT-6 评自己的牛津新书:水准达顶刊书评 — anselm · 2026-09-07
- 学者反驳黄仁勋 AGI 论:刷分好不等于通用智能 — ValerioCapraro · 2026-09-07