Teknium:DeepSeek V4 Flash本地推理可达70 tokens/s

Teknium · x · 2026-08-03

知名开源大模型作者 Teknium 在讨论本地大模型推理硬件时表示,使用 DGX Spark 等设备运行 DeepSeek V4 Flash 模型时,能够实现高达 70 tokens/秒的生成速度。\n\n这一数据回应了社区对本地昂贵硬件推理性能不足的担忧,证明了特定轻量级模型在端侧设备上已具备极高的实用吞吐率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →