Soofi S 发布 27 万亿 token 训练的 30B-A3B 开源模型

_ScottCondron · x · 2026-07-23

这条转发是在发布 Soofi S 的预训练技术报告。该模型是一个 30B-A3B 的 MoE 混合 Mamba 模型,训练于约 27 万亿 token,并刻意提高了德语语料权重。

报告里的几个重点是:

帖子本质上是在强调:这不是只放权重,而是把整个训练栈都尽量公开了。

所属事件:Soofi S 发布30B混合Mamba开源模型(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →