开发者用 24GB 显存训练 2B 开源模型,借 7B OLMo 嵌入冷启动
NineThreeTilNow · reddit · 2026-09-17
一位自称有 20 年 ML 经验、曾短期参与 Anthropic Opus 4 红队的开发者在 r/LocalLLaMA 汇报其小型稠密模型实验进展:
- 放弃 9B 方案,改用 OLMo tokenizer、dmodel 缩到 2048,构建 2B 基座 + 约 1B 参数的 Engram 表(1/2/3-gram 词表导致占比 50%,高于 DeepSeek 建议的 10-20%)
- 采用 40 层 SWA/Global 混合块,借鉴 Kimi K2/K3 风格的注意力残差流;因 Llama 许可证限制无法 Apache 2.0,遂整体重做
- 数据经 7B OLMo 生成 32-token 概率分布而非 one-hot 交叉熵,并借用降投影(5k→2048)的 embedding 与 LMhead,保留约 65% 大模型嵌入信息
- 仅训练 1500 万 token 后模型就出人意料地连贯,未出现经典早期重复刷 token 现象
- 称 100% 可在 24GB 显存上训练,代码/模型/数据后续将开源(GitHub/HF 已有部分)
「Infra」频道最新
- Cohere 用单个 CUDA megakernel 服务 30B 模型,batch 1 达 292 tokens/秒 — dl_weekly · 2026-09-17
- dotAI 演讲:llama.cpp 投机解码的 MTP、dflash 与 dspark 实践 — ngxson · 2026-09-17
- M5 Ultra 首批基准曝光:跑 Qwen3 27B q4 达 50 tok/s — Ashefromapex · 2026-09-17
- 6 个团队共用 API 账单没人说得清,一家公司拆解 LLM 成本管控方案 — Fit_Program7076 · 2026-09-17
- 开源 GPU profiler Graphsignal:让 AI agent 自己读性能数据调优 vLLM — l0g1cs · 2026-09-17
- 去中心化推理网络如何抓作弊主机:抽查+声誉+开源权重三重校验 — autoimago · 2026-09-17