Aleph Alpha 开源 Kolibri:78B 从零训练 MoE,每 token 仅激活 3.46B
solyarisoftware · x · 2026-10-04
德国公司 Aleph Alpha 发布从零训练的 MoE 模型 Kolibri,以 Apache 2.0 协议开源,并非 Qwen 微调:
- 架构:总参数 78.1B,每 token 仅激活 3.46B(约 4.4%),384 个路由专家,每次选 6 个 + 1 个共享专家
- 上下文:原生 256K,验证可用至 1M
- 语言与能力:德英双语,支持 tool calling,提供 none/low/medium/high 四档推理强度
- 官方评测(Aleph Alpha 自己的基准面板,对比 Qwen3.6-35B-A3B):AIME 2026 得 96.0 vs 91.0;GPQA Diamond 84.3 vs 83.4;LiveCodeBench v6 85.9 vs 82.5
- 部署:官方 FP8 权重约 78GB,官方 serving 配置下仍需大显存
值得注意的是基准数据来自厂商自建评测,参考即可。
所属事件:德国 Aleph Alpha 开源 Kolibri-1:78B 仅激活 3.46B(14 条相关)→
「模型」频道最新
- 曝 OpenAI 拟合并 Chat 与 Codex 额度,基础聊天限额引担忧 — Iwantthegreatest · 2026-10-06
- 微软页面被曝证实 GPT-6 系列采用 Looped Transformer — teortaxesTex · 2026-10-06
- 亚马逊提出ALoDLM:按token难度自适应分配循环深度 — amazon · 2026-10-06
- IFM研究循环语言模型定点特性:KV缓存缩小3倍不掉分 — IFM · 2026-10-06
- 澳洲开源决策模型 Matilda Jev:单卡推理仅 56.8ms,不做文本生成 — Med1_Ai · 2026-10-06
- Codex 罕见吐槽用户幻觉自称记者兼工程师 — MikePFrank · 2026-10-06