开源项目 SlimServe:消费级显卡跑量化 LLM 推理
QuixiAI · x · 2026-09-07
开发者 QuixiAI 开源了 SlimServe 项目,主打在消费级硬件(如 RTX 3090)上高效服务量化模型,仓库包含针对 Qwen3 8-bit、GLM-5.2 等模型的部署与调优记录、性能基准与优化 pipeline 日志。项目内含 vLLM 相关代码、量化笔记(quants.md)、Metal 端 scaling 测试与 AMD Marlin GPTQ 支持等实验文档,适合想在本地做低成本 LLM 推理的工程参考。
所属事件:开发者 fork NVIDIA 驱动解锁消费卡 P2P,8×3090 跑 262K 上下文(8 条相关)→
「Infra」频道最新
- 黄仁勋官宣 GPT-6 Astra:用 10 万颗 Grace Blackwell 训练,称 AGI 已至 — himanshustwts · 2026-09-07
- Wan2GP 上架 Pinokio:6GB 显存一键跑 AI 视频生成 — cocktailpeanut · 2026-09-07
- Wan2GP AMD 版上架 Pinokio:RDNA2 起全系支持 — cocktailpeanut · 2026-09-07
- 晒一屋子硬件跑 OpenClaw,作者自嘲又造了一波 rage bait — HankYeomans · 2026-09-07
- 谷歌称高性能内存已占 AI 服务器物料成本 75% 以上 — Beth_Kindig · 2026-09-07
- 双 5090 本地跑多模型全自动产出产品演示视频,34 期零人工剪辑 — Ok_Cartographer_6086 · 2026-09-07