Kimi K3(2.8T)被塞进 MacBook Pro:四块 SSD 流式读取跑出 1 token/s
Argonautlabs · hn · 2026-09-09
HN 帖子展示 Deltafin 项目,把 2.8 万亿参数的 Kimi K3 权重放在四块 SSD 上流式加载,在 MacBook Pro 上以约 1 token/s 的速度推理。
- 亮点是“参数量不再受内存限制”的思路:权重不常驻内存,而是按需从 SSD 流式读取。
- 速度极慢,更多是工程演示与可行性验证,适合本地大模型/推理栈方向的玩家关注。
项目开源:argonautlabsai/deltafin。
「Infra」频道最新
- Epoch AI:GPT 与 Claude 长上下文定价差异或暴露架构不同 — scaling01 · 2026-09-09
- 百吉瓦算力什么样?一年需 876 太瓦时电、国家级电力系统 — shyamalanadkat · 2026-09-09
- vLLM 硬核复盘:管线并行遇热缓存失效,Kimi K3 解码吞吐 2.7 倍 — vllm_project · 2026-09-09
- vLLM 发布 AgentX 基准实测,全栈优化真实 Agent 推理服务 — vllm_project · 2026-09-09
- 谷歌云 CEO:自研芯片服务器回本周期不到 1 年,约为 GPU 一半 — matt_slotnick · 2026-09-09
- DeepSeek 限时放出 v4.1 Flash:1 美元可烧 5800 万 token — MicahBerkley · 2026-09-09