单卡RTX 6000跑DeepSeek V4:长文本推理飙升至1328 tok/s
mrstoatey · reddit · 2026-08-04
开发者使用推理优化工具 Krasis (v1.0.19),在单张 RTX PRO 6000 (96GB) 上对 DeepSeek-V4-Flash-0731 (INT4) 实现了显著的加速。
该工具通过在显存与系统内存间动态流式传输模型,在保留 6,440 个最热专家的同时,将其他部分卸载至内存。实测中,处理 2.3 万 token 的长提示词时,prefill 速度高达 1,328 tok/s;在 1K 上下文下解码速度达 29.4 tok/s。这为需要频繁传递大量上下文的编程智能体提供了极具性价比的本地部署方案。
「编程与Agent」频道最新
- Snorkel AI 构建企业模拟环境,训练智能体复杂工作流 — ajratner · 2026-08-05
- Goodfire 推出 Silico 平台,支持前沿级模型解释与训练 — Jeande_d · 2026-08-05
- Grok 模型接入 GitHub Copilot,实测构建全栈应用表现 — DanWahlin · 2026-08-05
- 实测 AI Agent 安装双系统:速度极快仅花 1 美分 — yacineMTB · 2026-08-05
- 播客探讨个人智能体开发:从解决自身痛点到发布产品 — msg · 2026-08-05
- 用 Claude Code 千小时总结:停止做这五件事效率更高 — tomcrawshaw01 · 2026-08-05