DeepSeek-V4-Flash 推理提速至 51.5 tok/s
antirez · x · 2026-08-27
开发者 Ivan Fioravanti 继续优化 DeepSeek-V4-Flash 在 M3 Ultra (DwarfStar) 上的推理性能,速度从 45.7 提升至 51.5 tok/s(+12.6%)。
关键细节:
- 采用 Q80 到 Q4K 的 attention+head 量化策略(虽非数学等价于 mxfp4)。
- 质量守门:全评测集得分 85/92(基准 82/92),AIME 得分 22→24/25。
- 正尝试通过 imatrix 校准恢复 CompSec 表现。
- 相关代码分支已上传 GitHub,模型将发布至 Hugging Face。
「编程与Agent」频道最新
- 开发者在 GBA 掌机上成功运行自建版宝可梦游戏 — IanArawjo · 2026-08-27
- MARS:多专家 LLM 接力系统,提升竞赛编程通过率 — Andrei Mikhailov · 2026-08-27
- 当前Agent只会被动响应?论「未解决状态」驱动的认知主动性 — GlenBradley · 2026-08-27
- Agent 架构实录:CoS 协调 20 个 Agent 与高并发 PR 实践 — RachelVT42 · 2026-08-27
- 微软谷歌推 WebMCP 标准:网站将适配 Agent 按钮 — HankYeomans · 2026-08-27
- 用本地 Qwen 模型分担 Claude Code 编程负载 — CodeSlave9000 · 2026-08-27