Looped Transformer 受热捧:Nanbeige4.2-3B 复现 3B 胜 12B 的 Agent 成绩

alexcovo_eth · x · 2026-09-08

The Information 报道称 OpenAI 的 GPT-6 Astra 采用「循环深度/Looped Transformer」架构后,rasbt 发文科普这一思路并不神秘——所谓 looped transformer 就是复用 transformer 块的层堆栈来增加容量而不增加参数。他举例指出,两个月前公开架构细节的 Nanbeige 已经这么做了:Nanbeige4.2-3B 从零预训练于 28T tokens。

南方北京的团队随即跟进宣传:该 3B 模型在 SWE-Bench Pro、Terminal-Bench、GDPval 等关键 Agent 基准上持续超越更大的模型(如 Qwen3.5-9B、Gemma4-12B)。团队还透露 Nanbeige4.5 正在训练,采用 LoopSplit、mHC + depth attention 与拼接 n-gram embedding。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →