德国主权开源模型 Kolibri:78B 参数仅激活 3.5B,AIME 达 96.9%
TejasKumar_ · x · 2026-10-04
Aleph Alpha 发布德国主权开源权重模型 Kolibri(Apache 2.0),总参数 78B 但每个 token 仅激活 3.5B,在 AIME 2025 数学竞赛上拿到 96.9%,超过所有被测 MoE 模型(包括每 token 激活量高 3 倍的),仅输给算力高 8 倍的稠密模型。
关键技术细节:
- 稀疏架构:每层 384 个小专家,路由器为每个词选 6 个,计算量如 3.5B 模型,但需约 78GB 显存(2 张 H100 或 1 张 H200)。
- 长上下文:多数层只看最近 512 token,每第 5 层看全部,因此能以可接受成本读取 100 万 token。
- 德语推理:团队发现少量德语推理数据反而有害(模型思维绕圈),于是造了约 80 万条德语推理样本。
- 会承认不知道:训练中隐藏部分文档片段,逼模型学会说"我不知道"。
Tejas Kumar 还实测其分词器:对德国宪法比 GPT-5 少 15% token,"Bundesverfassungsgericht"一词 GPT-5 需 6 个 token、Kolibri 仅 2 个,意味着德语推理更便宜更快。在 Aleph Alpha 自家评测中,它在其规模级别上英语和德语均居开源模型之首。
所属事件:德国 Aleph Alpha 开源 Kolibri-1:78B 仅激活 3.46B(14 条相关)→
「模型」频道最新
- Reflection AI 发布首个开源模型 Beam,估值 250 亿美元 — WebAssemblyMan · 2026-10-06
- 曝 OpenAI 拟合并 Chat 与 Codex 额度,基础聊天限额引担忧 — Iwantthegreatest · 2026-10-06
- 微软页面被曝证实 GPT-6 系列采用 Looped Transformer — teortaxesTex · 2026-10-06
- 亚马逊提出ALoDLM:按token难度自适应分配循环深度 — amazon · 2026-10-06
- IFM研究循环语言模型定点特性:KV缓存缩小3倍不掉分 — IFM · 2026-10-06
- 澳洲开源决策模型 Matilda Jev:单卡推理仅 56.8ms,不做文本生成 — Med1_Ai · 2026-10-06