Silia 修订版补上基准测试:0.5M 参数模型训练于 10 亿 tokens
SrijSriv211 · reddit · 2026-07-23
作者发布了自己小模型架构 Silia 的修订版论文和模型:这是一个 0.5M 参数 的 transformer,在 FineWeb-Edu 10 亿 tokens 上训练了 3 个 epoch。
这次修订补了什么
- 增加了对 Quark-v2、Spark-v4、SupraMini-v6 的对比测试;
- 基准包含 HellaSwag、PIQA、LAMBADA;
- 通过组合 DeepSeek MLA(不含 decoupled RoPE)、Qwen HydraHead 和 Apple Attention Free Transformer,缓解了 v1 中 2–2.5 倍 的计算与显存开销问题。
作者怎么取舍
- 没有继续做 Kimi 风格的 attention residuals,理由是想保持代码和论文更简单;
- 也坦承没有在论文里正确汇报训练 FLOPs,因为自己暂时没整理清楚。
作者同时放出了论文、Hugging Face 模型、GitHub 代码,以及 benchmark、loss 曲线和结构图。
「模型」频道最新
- Google 为 Gemini 3.6 Flash 和 3.5 Flash-Lite 加入 Computer Use — patloeber · 2026-07-24
- Google 为 Gemini 3.6 Flash 和 3.5 Flash-Lite 加入 Computer Use — patloeber · 2026-07-24
- 数学家断言:LLM 将揭开学术界「权威定理」的隐藏漏洞 — kylekabasares · 2026-07-24
- Polymarket 估算 Claude Opus 新模型明晚前发布概率达 82% — Polymarket · 2026-07-24
- 四个 AI 模型在 AITA 忠诚测试帖上推翻了 Reddit — soulsintention · 2026-07-24
- 微软称 MAI 模型已路由进 Copilot、Excel 和 Outlook — satyanadella · 2026-07-24