20B Looping 论文称用 10% 预训练 token 追平 Qwen3 Coder 30B
Dany0 · reddit · 2026-07-21
一篇关于 20B Looping model 的论文声称,它只用 10% 的预训练 token,性能就能匹配甚至超过 Qwen3 Coder 30B。
- 帖子估计这次训练成本可能只有几十万到十几万美元级别。
- 发帖者也提到,它并非在所有维度都超过 GPT-OSS 20B。
- 但核心意义很明确:如果真能把从零训练一个 LLM 的数据量从 35T token 压到 3.5T token,家庭级预训练就不再只是幻想。
所属事件:Loopie循环式Transformer发布,以极低成本追平大模型(7 条相关)→
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11