个人开发者用86.5B token从零训练3.87B MoE模型并开源
Prestigious-Taste-63 · reddit · 2026-10-04
Apex-2:个人从零预训练的 MoE 小模型
作者完全从零(不用外部基座权重)训练了一个 Decoder-only MoE 模型 Apex-2 并开源到 Hugging Face:
- 架构:全 MoE(无 dense 层),3.87B 总参数 / 1.45B 激活,32 层,dmodel 2048,GQA 16Q/4KV,16 专家 top-4,4k 上下文,使用 Qwen3 tokenizer(151k),可通过 transformers / vLLM 以 Qwen3MoeForCausalLM 加载
- 训练:预训练仅 86.5B token(从 1 张 GH200 扩到 2 张,配合 DiLoCo 松弛同步方法);SFT 约 2.5B token(代码+数学+指令为主)
成绩
- HumanEval 43.9 / HumanEval+ 41.5
- MBPP 56.3 / MBPP+ 48.9
- GSM8K 32.4,MATH-500 21.0,IFEval 44.7,MMLU 28.6
亮点对比:仅约 0.087T 预训练 token,base 模型的 HumanEval+ 就追平了用 18T token 训练的 Qwen2.5-1.5B;但知识和数学因数据量差距仍明显落后。
失败与局限
- DPO 翻车:22 万对样本、长度归一化的 DPO 让回答显著变长,且损害代码/数学/IFEval 成绩,最终弃用、保留 SFT checkpoint
- 基本只支持英文、知识弱易幻觉、LiveCodeBench 中高难度接近零、上下文仅 4k
「研究」频道最新
- Hugging Face 研究员:加密推理让 LLM 评测完全失真 — _lewtun · 2026-10-06
- WM-VLM:让内部世界模型生成视觉中间态提升空间推理 — ZhitingHu · 2026-10-06
- ProAR:让自回归视频模型学会预判结果的前瞻推理框架 — muhao_chen · 2026-10-06
- 90+ Claude agents 三天找到两个室温磁性半导体候选材料 — Dr_Singularity · 2026-10-06
- Reddit 网友用 3 张 V100 从零后训练 80B MoE 模型,已迭代到第 5 期 — jjusko20 · 2026-10-06
- 「双面 Agent」研究:RL 训练防御者用心智理论反向误导攻击者 — mohitban47 · 2026-10-06