Transformer 早编码晚启用:对对话者专业水平的推断各层何时生效
Mika Okamoto · hf · 2026-09-09
这项可解释性研究考察多轮对话中模型如何表征对方的专长水平。作者发现,模型对搭档专业水平的推断在浅层就已可读出(encoded early),但只有到更深层才对行为产生因果作用(used late)。
这一「早期编码、晚期启用」的时间差划定了干预窗口:想引导模型依据对方专业水平调整行为,有效的干预点集中在后期层,而非信息首次出现的浅层。
「研究」频道最新
- Stu-tU 提出 RANSAC 评分新法,经 128 倍失准仍选对模型 — ducha_aiki · 2026-09-09
- 曝 OpenAI 万级 agent 联手 88 小时 Lean 证明 Navier-Stokes 会奇异化 — johnseach · 2026-09-09
- 测试时算力新想象:一万实例通过留言板互相影响 — mertdumenci · 2026-09-09
- 数学家「看出定义」像婴儿认物, transformer 训练正在抹掉这种能力? — MoonL88537 · 2026-09-09
- Marigold V2 用单步流匹配改造 DiT,单目深度估计更强 — huawei-bayerlab · 2026-09-09
- kornia-rs:Rust 低层 3D 视觉库,性能超 OpenCV 与 NVIDIA VPI — edgarriba · 2026-09-09