16GB 内存跑 35B 大模型!QuarkStar 引擎实测破百 token/s
Nicolodeva · reddit · 2026-08-04
开发者推出了受 DwarfStar 启发的轻量级原生推理引擎 QuarkStar,专注于在普通消费级设备上运行大语言模型。
- 核心特性:支持在仅 16GB 内存的机器上完整常驻运行 Qwen3.6-35B-A3B 等模型;当显存不足时,可走 SSD 专家流式传输路径。
- 跨平台支持:实现了 Linux 下的原生 Vulkan 后端和 Apple Silicon 上的原生 Metal 后端。
- 实测性能:在价值约 150 美元的 AMD BC-250(16GB GDDR6)上,2K 上下文的预填充速度达 639 tok/s,生成速度达 81 tok/s。在 M2 Pro(16GB)上,2K 上下文生成速度为 37 tok/s。
该项目旨在探索低端硬件的极限推理能力,让无需花费数千美元购买顶级显卡的用户也能体验大模型。
「Infra」频道最新
- 成立7个月获30亿美元融资,Volta携百亿Anthropic订单入场 — matt_slotnick · 2026-08-04
- 128核CPU集群跑Codex:算力新解法 — BenBajarin · 2026-08-04
- Nscale 向牛津、UCL 等高校赞助百万美元算力 — _rockt · 2026-08-04
- 多模态API图片传输实测:Base64与预签名URL延迟对比 — Nigiva · 2026-08-04
- EON 获 1075 万美元种子轮,拟用卫星激光替代海底光缆 — oyhsu · 2026-08-04
- RTX 3090跑Minimax H3:15秒视频生成耗时22分钟 — pfeifits · 2026-08-04