20B Looping 论文称用 10% 预训练 token 追平 Qwen3 Coder 30B
Dany0 · reddit · 2026-07-21
一篇关于 20B Looping model 的论文声称,它只用 10% 的预训练 token,性能就能匹配甚至超过 Qwen3 Coder 30B。
- 帖子估计这次训练成本可能只有几十万到十几万美元级别。
- 发帖者也提到,它并非在所有维度都超过 GPT-OSS 20B。
- 但核心意义很明确:如果真能把从零训练一个 LLM 的数据量从 35T token 压到 3.5T token,家庭级预训练就不再只是幻想。
所属事件:Loopie循环Transformer发布,以极少token追平30B基线(7 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22