从磁盘流式加载权重对 LLM 不可行,但对决策模型或可热加载即用即卸
ostrisai · x · 2026-10-12
ostrisai 指出,对扩散模型和 LLM 这类现代大模型,从磁盘流式加载权重并不可行;但对「决策模型」可能效果很好——无需常驻内存保活,需要时随决策调用热加载、用完立即卸载即可。这一思路对小内存设备上运行小型决策模型有参考价值。
「Infra」频道最新
- 本地大模型推理正走向多卡并行,GPU 互联带宽成关键变量 — Dathide · 2026-10-12
- Project Maya 让 321B GLM-5.3-Flash 跑在单张消费级 GPU 上 — inthesearchof · 2026-10-12
- 16GB 显存本地部署选型:模型、推理优化与新推理服务器三线演进 — ECrispy · 2026-10-12
- 一张用量截图晒出 1100+ 台云虚拟机,最大单账户建了 738 台 — aniketmaurya · 2026-10-12
- AMD Strix Halo 本地跑 AI 写规格:qwen 慢 5-10 倍但活真能干完 — julianharris · 2026-10-12
- JAX 可跑 Apple GPU:jax-graft 用 Opus 5.5 写成开源后端 — twiecki · 2026-10-12