DeepSeek v4 单卡跑出 47 tok/s,通过 37 万针测
EAccelerate_42 · x · 2026-08-21
DeepSeek v4 Flash 0731 模型已优化至可在单台 DGX Spark 设备上流畅运行。该配置使用 EXL3 量化技术,在单流会话中实现了 47 tok/s 的生成速度和 1024 tok/s 的预填充速度,并通过了 37 万 token 的针测试。性能得益于原生的 NVFP4 KV 缓存支持,质量与 Q4KM / Q5 GGUF 相当。
「Infra」频道最新
- DevOps 面试题:如何用 CloudTrail 追踪 AWS 变更 — _jaydeepkarale · 2026-08-21
- 专家呼吁建设电网并强制液冷 — JHochderffer · 2026-08-21
- Liquid AI DSpark 草稿器上 iPhone,LFM2.5 解码速度翻倍 — helloiamleonie · 2026-08-21
- LLMRouter 开源库:16 种路由策略平衡成本与质量 — adnan_hashmi · 2026-08-21
- AI算力融资十周翻三倍:Broadcom百亿美元交易背后的分层信贷机制 — Servola-Journal · 2026-08-21
- 传英伟达拟数亿美元投资数据中心电力商 — Polymarket · 2026-08-21