玩家拼 CPU/RAM/SSD/GPU 混合系统,跑通 512K 上下文
HankYeomans · x · 2026-10-08
- 作者经过大量实验,用自组「Frankenstein」混合架构(CPU+RAM+SSD+GPU)在本地跑通了 512K token 的上下文,并提到所用模型为 DeepSeek V4.1 Flash 变体。
- 性能数据:在 16K/32K 上下文下 prefill 速度达 1,526 tok/s。对本地大上下文部署的可行性是个有趣的数据点。
「Infra」频道最新
- 独立模型 Glimmer 技术细节曝光:MacBook 上 4-bit 量化跑到 50 tok/s — TimDarcet · 2026-10-08
- 两张二手 3090 跑 Qwen3.8 27B 免费打赢 Haiku 5.5,还更好玩 — iamfakhrealam · 2026-10-08
- llama.cpp 新版修复 MacOS 上 Clef 模型精度严重偏低问题 — yuicebox · 2026-10-08
- 思科AI基建两年斩获93亿美元订单,CPO做客YC访谈 — ycombinator · 2026-10-08
- GLM 5.3 Flash 现身:DGX Spark 本地四路并发跑到 227 tok/s — natesiggard · 2026-10-08
- AWS CEO Matt Garman:2200 亿美元投入 AI 基础设施,谈为 Agent 重构云 — a16z · 2026-10-08