Looped Transformer 受热捧:Nanbeige4.2-3B 复现 3B 胜 12B 的 Agent 成绩
alexcovo_eth · x · 2026-09-08
The Information 报道称 OpenAI 的 GPT-6 Astra 采用「循环深度/Looped Transformer」架构后,rasbt 发文科普这一思路并不神秘——所谓 looped transformer 就是复用 transformer 块的层堆栈来增加容量而不增加参数。他举例指出,两个月前公开架构细节的 Nanbeige 已经这么做了:Nanbeige4.2-3B 从零预训练于 28T tokens。
南方北京的团队随即跟进宣传:该 3B 模型在 SWE-Bench Pro、Terminal-Bench、GDPval 等关键 Agent 基准上持续超越更大的模型(如 Qwen3.5-9B、Gemma4-12B)。团队还透露 Nanbeige4.5 正在训练,采用 LoopSplit、mHC + depth attention 与拼接 n-gram embedding。
「模型」频道最新
- 实测称 Astra 浏览器操作能力不错,速度仍偏慢 — jobergum · 2026-09-08
- Codex 实用技巧:让 Astra 读取剩余额度百分比,用英语设预算跑长任务 — Dimillian · 2026-09-08
- Matt Shumer 盛赞 GPT-6 Pro「是个怪物」,细节未明 — msg · 2026-09-08
- 「不是我不够聪明,是旧模型太烂」:强模型改变使用强度 — teortaxesTex · 2026-09-08
- Astra 宣布全球重置付费订阅用量,今天 6pm PST 生效 — infoxiao · 2026-09-08
- Codex 7 天限额可视化上线:红色表示跑在限额「前面」,绿色为「后面」 — lucasmeijer · 2026-09-08