16GB 内存 MacBook M1 上从零训练 100 万参数小语言模型
Slight_Ad_2894 · reddit · 2026-09-05
一位开发者分享了自己在 16GB 内存的 MacBook M1 上从零构建小型 LLM 的项目:使用法语语料作为数据集,BPE 分词器,训练了一个约 100 万参数的神经网络。目标是理解 LLM 的内部机制并教学,而非做出 SOTA 模型。
目前模型的输出语法尚可但缺乏上下文理解,无法很好地回答提问。作者在帖中求助优化资源,评论区的建议通常指向:参数量太小导致模型只会学语法而非知识,需要扩大规模、在指令数据上微调,或参考 nanoGPT、Karpathy 的「Let's build GPT」等从零教学资源。
「研究」频道最新
- 数学家补充:模型不只是一次性解题,专业数学家正这样用 AI — littmath · 2026-09-05
- Astra 胜过 Sol 但非湿实验 SOTA,难点在生物数据未公开 — nlarusstone · 2026-09-05
- STAT6 靶点已收 257 个分子,全量湿实验验证正式启动 — AllThingsApx · 2026-09-05
- 别把 AI 等同于 LLM:硬核科学领域经典 ML 仍是王者 — CatAstro_Piyush · 2026-09-05
- 斯坦福研究:中性数据也能让模型习得谄媚,DPO 等 7 种偏好优化均中招 — stanfordnlp · 2026-09-05
- Percy Liang 开源训练 Marin 535B-A23B,进度已达 13% — stanfordnlp · 2026-09-05