Soofi S 发布 27 万亿 token 训练的 30B-A3B 开源模型
_ScottCondron · x · 2026-07-23
这条转发是在发布 Soofi S 的预训练技术报告。该模型是一个 30B-A3B 的 MoE 混合 Mamba 模型,训练于约 27 万亿 token,并刻意提高了德语语料权重。
报告里的几个重点是:
- 在作者自己的评测里,它是英文和德文两个总榜上最强的完全开源模型,超过 Olmo 3 32B 和 Apertus 70B。
- 这次发布强调极高透明度:包含逐源数据说明、超参、训练与评测代码、检查点以及项目页面。
- 项目训练在德国电信基础设施上完成,作者还直接放出了完整的 Weights & Biases 仪表盘。
帖子本质上是在强调:这不是只放权重,而是把整个训练栈都尽量公开了。
所属事件:Soofi S 发布30B混合Mamba开源模型(2 条相关)→
「模型」频道最新
- 实测 Gemini 3.5 Flash-Lite:文档提取比 Claude 便宜 71 倍 — rseroter · 2026-07-23
- Sentdex 质疑 Kimi K3 对比 Nemotron 3 Ultra 的图表 — Daniel_Farinax · 2026-07-23
- 按显存档位整理的模型榜单:从 4GB 到 384GB — victormustar · 2026-07-23
- BTL-3 发布 27B 开源智能体编程模型,HumanEval 达 95.12% — soteko · 2026-07-23
- 测试丘吉尔风格骂人提示词,Claude 与 GPT 展现文风差异 — emollick · 2026-07-23
- NVIDIA 总结 Kaggle 挑战赛:开源模型推理优化实践 — NVIDIAAI · 2026-07-23