个人开发者用86.5B token从零训练3.87B MoE模型并开源

Prestigious-Taste-63 · reddit · 2026-10-04

Apex-2:个人从零预训练的 MoE 小模型

作者完全从零(不用外部基座权重)训练了一个 Decoder-only MoE 模型 Apex-2 并开源到 Hugging Face:

成绩

亮点对比:仅约 0.087T 预训练 token,base 模型的 HumanEval+ 就追平了用 18T token 训练的 Qwen2.5-1.5B;但知识和数学因数据量差距仍明显落后。

失败与局限

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →