社区讨论:EXL3 因缺乏 RAM 溢出支持而热度减退
silenceimpaired · reddit · 2026-08-17
Reddit 用户讨论了量化推理工具 EXL3 在社区中关注度下降的现象。虽然 EXL3 在 Token 生成速度和模型支持上常优于 llama.cpp,且通过 TabbyAPI 提供 OpenAI 兼容接口,但其不支持 RAM 溢出导致无法运行大型 MoE 模型。作者呼吁社区关注,以鼓励开发者继续维护这一备选方案。
「Infra」频道最新
- UBS 预测:光互连 2026 年转向 CPO,2030 年迈向全光 — BenBajarin · 2026-08-17
- 美光高管将出席峰会,谈AI如何改变存储商业模型 — GavinSBaker · 2026-08-17
- 推理芯片商 Groq 获 3.5 亿美元 A 轮融资,估值达 25 亿 — GroqInc · 2026-08-17
- Ninfer 跑 Qwen 3.8 27B:采样参数还要不要手动配? — Hekel1989 · 2026-08-17
- 单卡 GH200 跑 DeepSeek V4 Flash:DSpark 加速 2.7 倍实操指南 — funding__secured · 2026-08-17
- OpenAI 租赁俄州 8GW 数据中心,英伟达担保千亿 — The Decoder · 2026-08-17