20B Looping 论文称用 10% 预训练 token 追平 Qwen3 Coder 30B
Dany0 · reddit · 2026-07-21
一篇关于 20B Looping model 的论文声称,它只用 10% 的预训练 token,性能就能匹配甚至超过 Qwen3 Coder 30B。
- 帖子估计这次训练成本可能只有几十万到十几万美元级别。
- 发帖者也提到,它并非在所有维度都超过 GPT-OSS 20B。
- 但核心意义很明确:如果真能把从零训练一个 LLM 的数据量从 35T token 压到 3.5T token,家庭级预训练就不再只是幻想。
所属事件:Loopie循环式Transformer发布,以极低成本追平大模型(7 条相关)→
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11