Soofi S 发布 27 万亿 token 训练的 30B-A3B 开源模型
_ScottCondron · x · 2026-07-23
这条转发是在发布 Soofi S 的预训练技术报告。该模型是一个 30B-A3B 的 MoE 混合 Mamba 模型,训练于约 27 万亿 token,并刻意提高了德语语料权重。
报告里的几个重点是:
- 在作者自己的评测里,它是英文和德文两个总榜上最强的完全开源模型,超过 Olmo 3 32B 和 Apertus 70B。
- 这次发布强调极高透明度:包含逐源数据说明、超参、训练与评测代码、检查点以及项目页面。
- 项目训练在德国电信基础设施上完成,作者还直接放出了完整的 Weights & Biases 仪表盘。
帖子本质上是在强调:这不是只放权重,而是把整个训练栈都尽量公开了。
所属事件:Soofi S 发布30B混合Mamba开源模型(2 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11