Soofi S 发布 27 万亿 token 训练的 30B-A3B 开源模型
_ScottCondron · x · 2026-07-23
这条转发是在发布 Soofi S 的预训练技术报告。该模型是一个 30B-A3B 的 MoE 混合 Mamba 模型,训练于约 27 万亿 token,并刻意提高了德语语料权重。
报告里的几个重点是:
- 在作者自己的评测里,它是英文和德文两个总榜上最强的完全开源模型,超过 Olmo 3 32B 和 Apertus 70B。
- 这次发布强调极高透明度:包含逐源数据说明、超参、训练与评测代码、检查点以及项目页面。
- 项目训练在德国电信基础设施上完成,作者还直接放出了完整的 Weights & Biases 仪表盘。
帖子本质上是在强调:这不是只放权重,而是把整个训练栈都尽量公开了。
所属事件:Soofi S 发布30B混合Mamba开源模型(2 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11