独立开发者实测:纯 CPU 跑 10B 模型达 113-130 tok/s,但质量拉胯
WildPino25 · reddit · 2026-09-15
Reddit 用户 WildPino25 展示自研的面向 CPU 内存约束的 LLM 架构 SiliconLLM:10B 参数模型在 Ryzen 5 3600X(无 GPU)上达到 113-130 tok/s,但权重质量很差。为验证质量能否在规模化下保持,他尝试在 T4 上训练 206M 模型(需 8 周以上),并尝试把 Qwen2.5-Coder 转换为其 SSM/三值/稀疏格式,发现改造 transformer 供体模型非常困难。代码与研究分支开源在 GitHub。
「Infra」频道最新
- Helion 聚变能源 G 轮超额认购,最终募足 5 亿美元 — ycombinator · 2026-09-16
- nginx 1.31.6 修复 HTTP/3 堆缓冲区溢出漏洞 CVE-2026-90439 — jedisct1 · 2026-09-16
- AWS Trainium 原生跑 PyTorch,PyTorch Con 公布主题演讲 — PyTorch · 2026-09-16
- 长文详解:为什么本地跑推理模型是刚需,你需要无审查模型 — HankYeomans · 2026-09-15
- DGX Spark 本地跑 TRELLIS.2:铅笔草图一键转 3D GLB — jasonkneen · 2026-09-15
- 放弃再买 5090:本地推理用户改投 Spark,省心还能跑更大模型 — ideamaker321 · 2026-09-15