21M 小模型配 6.4B 查找表,追平 114M 稠密模型
fechyyy · reddit · 2026-10-07
Reddit 用户分享业余研究项目:给小模型外挂超大「记忆表」(product-key memory 思路,Lample et al. 2019 / Meta "Memory Layers at Scale"),验证其真实价值与部署成本。
- 核心结果:21M 模型 + 16.8M 行查找表(表内 6.4B 参数,每 token 实际只用约 33M),在同样 500M Wikipedia tokens 上训练,效果约等于 114M 稠密模型。
- 表不必放显存:4-bit 量化后从 NVMe SSD 内存映射,在 RX 9070 上仍能跑到约 140 tok/s,仅占 0.4GB 显存;但长 prompt 从 SSD 读很慢,每次 miss 要读整 4KB 页。
- 写了 Triton kernel,可不经修改跑在 Radeon、MI350X 和 H100/H200 上。
- 失败尝试:给训练好的 Qwen3.5-0.8B 事后外挂表,效果不比同算力的小稠密插件好。
- 作者自述局限:模型极小、大跑只有单个 seed、输出是流畅但编造事实的 Wikipedia 风格文本;所有失败也写进了报告。大部分跑在自己的游戏 PC,大跑约花 70 美元 Runpod 算力,与 Claude Code 协作完成。
- 开源了代码、交互式可视化(点击单词查看模型读了哪些表项)和模型权重。
「Infra」频道最新
- Mistral CEO:Mistral Large 4 用自有算力训练,「RL 无饱和迹象」 — sivareddyg · 2026-10-07
- Hugging Face 工程师开源本地 AI 部署幻灯片:从量化到投机解码全覆盖 — mervenoyann · 2026-10-07
- Ollama 0.35 引入本地决策模型:简单分类别再用聊天模型 — Technovangelist · 2026-10-07
- CostGraph 宣布成为 InfraCost 替代品,可查 L40 到 A100 各类 GPU 价格 — saheedniyi_02 · 2026-10-07
- Oki Home 推出「记忆电脑」:本机跑 27B 模型,1799 美元起 — Scobleizer · 2026-10-07
- 6 秒转录 1 小时语音:Phonon-2 Core ML 版达 606 倍实时,内存砍至 1.1GB — julianweisser · 2026-10-07