可解释性实验让两种场景记忆碰撞
graceisford · x · 2026-07-13
这条转述了一组关于 world generation model 的机械可解释性实验:作者在生成过程里尝试 activation patching,把一段由莫奈《罂粟花田》生成时的中间层激活,注入到同层的纽约 Manhattanhenge 生成过程中。
结果呈现出一种“两个记忆在争夺同一片区域”的效果,作者借此强调:机械可解释性可以和艺术生成结合,用可控的中间层干预观察模型内部表征如何影响输出。
「研究」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11