4070 Ti 实测:Kimi K3、DeepSeek V4 本地推理性能报告

JayB_Official · reddit · 2026-08-25

作者通过自定义推理运行时项目 CRANE V2,测试了在普通消费级 Windows 机器(Ryzen 7800X3D + RTX 4070 Ti 12GB + 32GB RAM)上运行超大 MoE 模型的极限。

测试目标: Kimi K3 (2.779T)、DeepSeek V4 Flash、Qwen3.5-122B。

核心发现(速度 vs 质量):

作者明确区分了“速度极限测试”和“保质量测试”。单纯追求高速度(如 57 tok/s)往往通过牺牲质量(静态路由、跳过共享专家)实现,输出甚至变成多语言垃圾。

技术优化手段:

结论:目前这些超大模型在 4070 Ti 上尚不具备实用性的本地运行能力,但实验证明通过精心的运行时设计,可以在有限硬件上榨取更多性能。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →