矿卡改FPGA跑Qwen3.5:280美元卡上9B INT4推理实测
I_am_purrfect · reddit · 2026-10-05
项目背景
作者长期想在 FPGA 上跑 LLM 推理。Qwen3.5 发布后,9B-27B 规模的模型终于有足够吸引力,于是寻找便宜的大容量 FPGA。选中的是 SQRL FK33(约 280 美元,8GB HBM2,约 400GB/s 带宽,eBay 矿卡),后升级到双 VU35P 的 Jungle Cat(375 美元)。实现主要靠 Claude Opus 4.8/5.5 和 Kimi K3 辅助编写 RTL。
实测结果
- Qwen3.5-9B INT4,双 FK33 @75MHz 流水线切分:预填约 6 tok/s(256 token prompt),生成约 3.2 tok/s 起步、2-3k 上下文时约 2.4 tok/s;结果与 llama.cpp 逐层核对一致
- Qwen3.8-27B INT4(据 9B 实测按操作建模,尚未运行):现有设计双 die @75MHz 约 1.1 tok/s 生成;RTL 重映射到大 die + 200MHz 约 8 tok/s 生成;4x VU35P 四路张量并行 @200MHz 估算短上下文约 25 tok/s、16k 约 10 tok/s、262k 满上下文约 1 tok/s。两 die 因 27B 的 KV cache 放不下,上下文上限约 45k,跑满 262k 需四 die。
延伸估算
作者还让 Opus 5.5 估算把该 RTL 做成 ASIC:TSMC 2023 N3 工艺 + 6 层 HBM3(4.9TB/s)、2GHz 下,27B 短上下文约 294 tok/s、262k 约 10 tok/s,功耗约 125-340W。另外花 60/75 美元收的两块 BC-250 被认为是性价比极高的辅助工具。
项目 MIT 开源:llm.vhdl
「Infra」频道最新
- 美光 CEO:2027-2028 年内存供应将比 2026 年更紧张 — chillinewman · 2026-10-05
- 2.6B 竟胜 2B:LFM2.5 速度更快、内存省 1.3GB 实测对比 MiniCPM5 — parepeg · 2026-10-05
- 独立开发者省钱组合:Firebase+Cloudflare R2+Vercel 最便宜 — jdluk87 · 2026-10-05
- 16GB 显存跑 35B MoE:fork llama.cpp 实现 experts 扩容提速至 60 tok/s — Specific-Tax-6700 · 2026-10-05
- Reddit 网友用游戏本+iPhone+Tailscale 搭起本地 AI Agent 网络 — Due_Recording_5802 · 2026-10-05
- 本地小模型能干什么:扫描代码库、复盘 AI 会话、整理媒体库 — natesiggard · 2026-10-05