双卡RTX 6000本地实测DeepSeek V4

开发者在两张RTX PRO 6000 Blackwell显卡上实测了DeepSeek-V4-Flash-0731模型的本地推理性能。结合DSpark投机解码技术,该模型跑出了243 tok/s的高速度。然而受限于显存瓶颈,当前硬件配置下的上下文长度受限,且仅能支持单人单次使用,揭示了顶级大模型本地化部署面临的算力与显存挑战。

2026-08-02 ~ 2026-08-02 · 2 条相关