花 250 美元复现 Mini Kimi-K3,性能超越 GPT-2
OtherRaisin3426 · reddit · 2026-08-20
作者分享了花费 250 美元从头预训练一个 10.2 亿参数 Mini Kimi-K3 模型的过程。该模型复刻了 Kimi K3 的核心架构(包括 Kimi Delta Attention、Gated MLA、LatentMoE 等),使用了 50 亿去污 Token。尽管规模仅为 K3 的两千分之一,但在未进行指令微调的情况下,其 HellaSwag 评分达到 33.4%,超过了 GPT-2 (124M) 的 28%。
「模型」频道最新
- 智谱 GLM-5.3 仅靠后训练将 DeepSWE 分数从 44 提至 69 — haider1 · 2026-08-20
- DeepSeek 涨价后用户留存情况投票引发关注 — oran_ge · 2026-08-20
- Cohere 揭示 LLM 语言推理瓶颈:14B 模型反超大模型 — Cohere_Labs · 2026-08-20
- 2.5 小时训练 1.35亿参数小模型全流程 — EAccelerate_42 · 2026-08-20
- Ornith-1.5-9B 登顶 Hugging Face 热榜,支持图像文本输入 — ornith-ai · 2026-08-20
- 去安全版 Qwen2.5-72B 登陆 Mac,实测零拒绝但风险激增 — petrusenko_max · 2026-08-20