丢弃瞬态计算状态或成 Transformer 的自我修正机制
hive_echo · x · 2026-09-06
@hiveecho 在 Langford 的架构讨论串中提出:把当前时间步的计算状态带入下一步可能污染后续状态,导致循环状态漂移(尤其在连续应用时)。而某时间步的计算往往是瞬态的、只适应当下状态,不携带它前进可以让模型更容易重现、修正或替换先前状态的计算,甚至开启全新计算——因此丢弃瞬态计算状态实际上可能通过降低对早前内部计算的路径依赖,提供一定程度的自我修正能力。
所属事件:Langford 探讨 Transformer 信息丢弃与架构设计启示(3 条相关)→
「研究」频道最新
- OpenAI 首次公开模型加速内部研究数据,呼吁行业透明化 RSI 进展 — kliu128 · 2026-09-06
- 研究者呼吁实验室在 RL 训练中加入重构与删除类编码任务 — kuza55 · 2026-09-06
- 1958 年感知机被双向误读:NYT 吹捧意识机器,11 年后被打入冷宫 — techNmak · 2026-09-06
- dair-ai 本周 AI 论文榜:Declarative Attention 居首 — dair_ai · 2026-09-06
- 长文反驳功能主义:仅保留模式并不能免费换来意识 — pwlot · 2026-09-06
- 意识争论:数字模拟无法实例化因果属性,丘奇-图灵论题救不了 — pwlot · 2026-09-06