回应循环 Transformer 之争:测试时动态计算与内省才是关键杠杆
PlisSergey · x · 2026-09-03
bobthemaster 认为,比起争论循环深度/循环 transformer 块,真正的杠杆在动态测试时计算与内部精炼,并举三例:
- MIND over Body(ICLR Oral):自内省的动态计算,仅 3 层就在 ImageNet 上超过 ResNet-50(96.62%),以极小参数开销在 SQuAD 上表现出色。
- Change of Thought:不依赖外部 token 解码突破 TC^0 上限,让注意力权重在测试时迭代收敛到不动点,准确率最高 +20%。
- Fixed-Point Self-Attention (FPSA):零额外参数,在注意力模块内部迭代 queries 和 keys。
PlisSergey 回应称,要走向自主的主权 AI,确实需要多层级的嵌套反馈与内省能力。
所属事件:Looped Transformer 之争:是突破创新还是绑参加深(7 条相关)→
「研究」频道最新
- HCI 论文暗用 LLM 评审员,行文刻意遮掩难以识别 — IanArawjo · 2026-09-03
- 为什么 VRChat 粒子池能凑合用:重力让状态自然趋同 — Michael_Moroz_ · 2026-09-03
- Radix Sort 优化到每秒 50 亿对排序,零 compute shader 开销 — Michael_Moroz_ · 2026-09-03
- 开发者把 VRChat 流体模拟移植进 Udon,真 SPH 无近似求解 — Michael_Moroz_ · 2026-09-03
- PRO-Step:步级过程奖励优化 RAG,拿下五个基准最佳 EM/F1 — _reachsumit · 2026-09-03
- Meta 开源 CORAL:LLM 智能体闭环优化生产级推荐系统 — _reachsumit · 2026-09-03