Exllamav3 实测:8x3090 跑出 700tk/s
Leflakk · reddit · 2026-09-02
用户在 8x3090 配置上实测 Exllamav3 引擎运行 GLM 5.3 Flash (Q4 量化),预填充速度达 700 tokens/s,解码速度 42 tokens/s,性能优于 lcp 与 vllm,且处理 3000 万 tokens 未遇质量问题。
「Infra」频道最新
- 美光台湾发史上最大绩效奖防罢工,HBM 员工超 1.5 万人 — zephyr_z9 · 2026-09-02
- MLPerf Storage v3.0 发布:144 项成绩,新增 KV 缓存与向量数据库测试 — TheKanter · 2026-09-02
- Cloudflare Agents 支持 OpenTelemetry 追踪,可直连 Braintrust 评估 — ritakozlov · 2026-09-02
- 进步派拉比谈数据中心禁令:为环保劳工争取筹码的策略 — joshua_saxe · 2026-09-02
- 英特尔高官:AI 时代安全需从硅片底层设计 — BenBajarin · 2026-09-02
- PyTorch 2.14 发布:2995 次提交,487 位贡献者参与 — PyTorch · 2026-09-02