降低 LLM 硬件成本新思路:用 ROM 存储权重

sirzerp · reddit · 2026-08-18

Michael Snyder 提出了一种降低 LLM 部署成本的新架构:“Frozen Weights, Fast ROM”。

核心观点:

部署后的模型权重是只读的,却存储在昂贵且稀缺的 HBM/DRAM 中。文章建议将基础权重“烧录”到廉价的高密度 Mask ROM 中(类似游戏卡带),仅在动态内存(DRAM)中保留微小的 LoRA 差异(Diff)用于微调和更新。

反驳“ROM 太慢”:

文章指出 ROM 的速度瓶颈在于接口和封装,而非存储元件本身。如果采用现代接口构建,ROM 可以达到 RAM 的速度,且因为没有电容、刷新和写入路径,其密度更高、功耗更低。

相关实践:该架构结合了 LoRA(差异机制)、Apple 的 Flash Streaming 和 Taalas 的硬化 LLM ASIC(已被 AMD 收购)等现有技术。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →