普林斯顿团队指 OpenAI 新架构与自家 T2MLR 论文多处相似
prfsanjeevarora · x · 2026-09-05
普林斯顿教授 Sanjeev Arora 称 OpenAI 新架构在近期多项工作(包括其团队)中有多个近似先例。其团队一年多前开始写 T2MLR 训练代码,今年 3 月初投 ICML workshop 被拒,未及时挂 arXiv。
T2MLR(Transformer with Temporal Middle-Layer Recurrence)核心内容:
- 针对 autoregressive 解码压缩中间计算、推理状态难以跨时间持续的问题,将上一 token 的中层缓存表征直接融入当前 token 的较早层,让抽象中间计算跨解码步持续
- 在自然语言预训练与多跳推理微调上,稳定超过数据与参数匹配的 Transformer 基线
- 只对约 20% 网络的局部中层块做循环,常优于全层循环
- 无需从头预训练:把循环通路加装到现有 1.7B 预训练 Transformer 上短暂微调即可显著提升数学推理
「研究」频道最新
- Knuth TAOCP 全卷开放难题整理成数据集,称其为前沿模型最佳基准 — sytelus · 2026-09-05
- 逆转 Eroom 定律:临床试验为何是生物医药的真正瓶颈 — anshulkundaje · 2026-09-05
- 争议预印本:用集成模型包住 LLM,声称实现现象性意识 — PeterBowdenLive · 2026-09-05
- 微调随机数也能传偏置,subliminal learning 让人不安 — ryanorban · 2026-09-05
- 调查668名开发者:读者一旦怀疑文章是AI写的就会拉黑作者 — IanArawjo · 2026-09-05
- Randomized YaRN 问世:短文本训练即可提升 128K 上下文推理 — gregd_nlp · 2026-09-05