Reddit 网友整理开源 LLM 推理优化项目与论文大合集
Dramatic-Chard-5105 · reddit · 2026-09-04
一位 Reddit 用户汇总了近期助力开源 LLM 优化、效率与可及性的开源项目和论文,主要分两类:
推理与硬件优化项目
- colibri:把 VRAM+RAM+存储当作统一推理内存层级管理,专注 MoE 专家流式加载
- exo:异构拓扑感知的 Mac 集群推理
- MLX 生态:JACCL TB5 实测、TCP/Ring 分布式推理(无需 RDMA)、Apple Silicon 按需专家加载(mmap + 预取器 + LRU)
- 后摩(Houmo)DRAM-PIM:算内嵌于 DRAM,目标 >1TB/s 带宽、能效约 3 倍提升
- d-Matrix 3DIMC:3D DRAM + 数字存内计算,「把算力搬向权重」路线
- Lucebox:约 7000 美元的本地 AI 工作站
推理研究论文
- MDI-LLM:低功耗边缘节点间的模型分割与循环流水线并行
- WDMoE:专家分布到边缘/移动设备,含 Jetson 实测平台
- OD-MoE:预测器提前多层预判专家并按需加载,专家预测准确率 99.94%,以 1/3 显存达到全缓存约 75% 解码速度
- MoE-SpeQ / SP-MoE:投机解码 + 专家预取,分别报告最高 2.34× 加速与异步 I/O 流水线方案
- MoE-Spec:证明「投机解码并非自动解决 MoE」,验证深度存在预算权衡
「Infra」频道最新
- 黄仁勋基金会出资,Marin 535B-A23B 开源模型训练完成 13% — dlwh · 2026-09-04
- ChatGPT 宕机时他用双 RTX 6000 Pro 本地跑 DeepSeek 剪视频 — HankYeomans · 2026-09-04
- AI 应用安装器 Pinokio 8.2.0 发布,新增万能磁盘清理功能 — cocktailpeanut · 2026-09-04
- 推理引擎被指是被忽视的攻击面,模型或可影响解码路径 — JeremyCMorgan · 2026-09-04
- browser-llm-fit:下载前先测模型能否在你的浏览器跑 — init0 · 2026-09-04
- YC S26 Demo Day 下周举行:漂浮数据中心、钻石半导体登场 — ycombinator · 2026-09-04