FlashAccel:利用高带宽闪存加速 LLM 推理
9r4n4y · reddit · 2026-08-30
一篇论文介绍了 FlashAccel,旨在利用高带宽闪存 (HBF) 来实现高吞吐量的 LLM 推理。HBF 在相同成本下提供了比 HBM 高 8 到 16 倍的容量,且带宽可达 3 TB/s。
「Infra」频道最新
- SpaceX 自建涡轮铸造厂,为 AI 算力解决供电瓶颈 — rohanpaul_ai · 2026-08-30
- 已有强力 PC 跑 LLM,Mac 还该上 64GB 内存吗? — gappyvalley · 2026-08-30
- RTX 5090 跑 MiniMax H3 速度异常慢:疑似显存抖动 — Suspicious-Walk-815 · 2026-08-30
- llama.cpp 启用 NUMA 镜像,双路 EPYC 推理性能暴增 137% — mattescala · 2026-08-30
- 推个人 AI 数据中心 Autonomous,2.6 万美元起售 — dee_hw · 2026-08-30
- 双 A100 显卡当前最佳的 LLM 推理方案是哪个? — Theio666 · 2026-08-30