5KB 纯 x86 汇编跑 Gemma-2B:CPU 上 4.6 tok/s
tom_tsai28 · reddit · 2026-10-04
开发者 tomtsai28 分享了个人项目 PULSAR-ASM:完全用扁平 x86-64 汇编(FASM)手写、为 Gemma-2B 打造的推理引擎,探索在裸金属上运行自回归 LLM 的最小足迹。
关键数据:
- 总机器码仅 5.2 KB(引擎 3.7 KB + 自定义 AVX2/F16C GEMM 内核 1.5 KB)
- 纯 AVX2 + F16C,自定义 4 线程 SMP GEMM 做 prefill,在普通 DDR4-2400 上跑出约 18.5 GB/s 内存带宽
- 老款四核 i5 桌面 CPU 上 FP16 解码速度 4.54.7 tok/s
- 零 C/C++ 运行时、零 PyTorch,Python 端只用 ctypes 调 VirtualAlloc 和系统线程
作者表示无意与 llama.cpp 竞争,而是第一性原理地探究现代 Transformer 能多干净地映射到裸硅,并为未来 MCU/DSP 等资源受限平台上的微型 LLM 提供参考。代码与架构复盘文档已在 GitHub 开源。
「Infra」频道最新
- 64GB 内存之痛:Strata 让本地跑 Qwen3.8-Flash-Next 提速到 60 t/s — Cautious_Chicken_604 · 2026-10-04
- 受 BLAKE3 启发的哈希函数 Bab 发布,支持流式验证 — carsonfarmer · 2026-10-04
- 算力正成新货币:OpenAI 曾以 200 万美元模型额度换 YC 初创公司股权 — AccBalanced · 2026-10-04
- 2分钟讲清 Postgres 与向量数据库的区别 — aronchick · 2026-10-04
- 网友求证:Qwen 新模型在 RX6700XT 上实测表现 — Loose_Doubt367 · 2026-10-04
- Cerebras CEO:架构选择避开 HBM、CoWoS 与台积电 3nm 三大瓶颈 — rohanpaul_ai · 2026-10-04