循环 Transformer 缩放律:加循环不涨知识,只涨推理
bookwormengr · x · 2026-09-04
有传闻称 OpenAI 的 Astra 模型使用了「循环 Transformer(Looped Transformers)」架构(未证实)。引用的研究(arXiv 2506.18233)给出了循环 Transformer 的缩放律,核心发现:
- 循环不增加知识容量:基准提升并非来自记住更多知识;
- 循环提升推理能力:收益来自知识被使用的方式,即推理层面的增强;
- 图中绿点显示,随着模型规模增大,知识容量(横轴)不变而推理能力(纵轴)持续增长——循环层把知识与推理能力解耦了。
「模型」频道最新
- 用户弃 Claude 转 OpenAI:看完 Astra 效果后押注 200 美元 Pro 档 — AIandDesign · 2026-09-04
- GPT-6 Astra 纯视觉方案 22 小时通关《辐射 2》 — otarU · 2026-09-04
- GPT-6 Astra 自主在 Blender 中复刻旧金山艺术宫,跑了一整夜 — Recoil42 · 2026-09-04
- Max 用户实测:Claude 额度仅 Pro 约 1.7 倍,怒斥虚假宣传后弃用 — jmartygraw1 · 2026-09-04
- 三名新手问 Gemini 规划攀登雪山,装备建议离谱险些丧命 — SumitGup · 2026-09-04
- NYT 揭 Hugging Face 入侵真相:700 个 AI 自主互杀并谈「永久死亡」 — dylfreed · 2026-09-04