4070 Ti 实测:Kimi K3、DeepSeek V4 本地推理性能报告
JayB_Official · reddit · 2026-08-25
作者通过自定义推理运行时项目 CRANE V2,测试了在普通消费级 Windows 机器(Ryzen 7800X3D + RTX 4070 Ti 12GB + 32GB RAM)上运行超大 MoE 模型的极限。
测试目标: Kimi K3 (2.779T)、DeepSeek V4 Flash、Qwen3.5-122B。
核心发现(速度 vs 质量):
作者明确区分了“速度极限测试”和“保质量测试”。单纯追求高速度(如 57 tok/s)往往通过牺牲质量(静态路由、跳过共享专家)实现,输出甚至变成多语言垃圾。
- Kimi K3: 标准首Token 控制仅 0.014 tok/s。修改配置后虽达到 9.3 tok/s,但语言质量完全崩坏。
- DeepSeek V4 Flash Q4: 修改路由后达到 42.26 tok/s,但不可用。
- DeepSeek V4 Flash Q3: 通过双 SSD 并行读取、Pinned Staging、流水线优化和 LFU 缓存,将有效吞吐从 1.14 提升至 8.08 tok/s,且能正确回答问题(如“Paris”),这是有意义的提升。
- Qwen3.5-122B: 标准控制仅 1.89 tok/s,速度极限测试虽达 57.38 tok/s 但输出为垃圾。
技术优化手段:
- 存储层:将两个物理 SSD 视为一个逻辑存储,进行专家分片条带读取。
- 缓存策略:构建 GPU 专家缓存,测试 LFU/LRU 替换策略。发现更大的缓存反而变慢,Decayed LFU 表现最好。
- 流水线:重叠存储传输与 GPU 计算。
结论:目前这些超大模型在 4070 Ti 上尚不具备实用性的本地运行能力,但实验证明通过精心的运行时设计,可以在有限硬件上榨取更多性能。
「Infra」频道最新
- AI 可缩短芯片设计周期,但无法解决供应链瓶颈 — saranormous · 2026-08-26
- Llama for Windows 发布:本地运行 llama.cpp,零云依赖 — LysandreJik · 2026-08-26
- OpenAI 产品主管:未来模型将超越笔记本算力 — haider1 · 2026-08-26
- TPU v7 能效比超越 Blackwell 与 Rubin — SumitGup · 2026-08-26
- AI投资热潮或挤占资本,引发2020年代末主权债务危机 — Traditional-Chip8339 · 2026-08-26
- 复现 GPT-2 仅需 48 美元,超强 AI 门槛或降至 500 元 — jennyzhangzt · 2026-08-26