Soofi S 发布 27 万亿 token 训练的 30B-A3B 开源模型
_ScottCondron · x · 2026-07-23
这条转发是在发布 Soofi S 的预训练技术报告。该模型是一个 30B-A3B 的 MoE 混合 Mamba 模型,训练于约 27 万亿 token,并刻意提高了德语语料权重。
报告里的几个重点是:
- 在作者自己的评测里,它是英文和德文两个总榜上最强的完全开源模型,超过 Olmo 3 32B 和 Apertus 70B。
- 这次发布强调极高透明度:包含逐源数据说明、超参、训练与评测代码、检查点以及项目页面。
- 项目训练在德国电信基础设施上完成,作者还直接放出了完整的 Weights & Biases 仪表盘。
帖子本质上是在强调:这不是只放权重,而是把整个训练栈都尽量公开了。
所属事件:Soofi S 发布30B混合Mamba开源模型(2 条相关)→
「模型」频道最新
- 开发者呼吁谷歌:下一代Gemma请做1T参数基座模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27