降低 LLM 硬件成本新思路:用 ROM 存储权重
sirzerp · reddit · 2026-08-18
Michael Snyder 提出了一种降低 LLM 部署成本的新架构:“Frozen Weights, Fast ROM”。
核心观点:
部署后的模型权重是只读的,却存储在昂贵且稀缺的 HBM/DRAM 中。文章建议将基础权重“烧录”到廉价的高密度 Mask ROM 中(类似游戏卡带),仅在动态内存(DRAM)中保留微小的 LoRA 差异(Diff)用于微调和更新。
反驳“ROM 太慢”:
文章指出 ROM 的速度瓶颈在于接口和封装,而非存储元件本身。如果采用现代接口构建,ROM 可以达到 RAM 的速度,且因为没有电容、刷新和写入路径,其密度更高、功耗更低。
相关实践:该架构结合了 LoRA(差异机制)、Apple 的 Flash Streaming 和 Taalas 的硬化 LLM ASIC(已被 AMD 收购)等现有技术。
「Infra」频道最新
- 日志分析显示 OpenAI/Anthropic 暂未抓取 llms.txt — gaganghotra_ · 2026-08-18
- M4 Pro 实现单目深度模型 8ms 实时推理 — fofrAI · 2026-08-18
- Cloudflare Durable Objects 上线版本流量监控面板 — ritakozlov · 2026-08-18
- Magnitude CLI 新增模型目录,自动评测本地硬件适配性 — Dan_Jeffries1 · 2026-08-18
- 从本地到主权 AI:产业边界在哪里? — rio_ARC · 2026-08-18
- City2Graph 库发布:地理空间数据转图结构 — tom_doerr · 2026-08-18