两台 DGX Spark 跑智能体编码:日处理 1 亿 token 的经济账

HarveenChadha · x · 2026-08-02

开发者分享了基于本地硬件运行智能体编码工作负载的实测估算:使用两台 DGX Spark 运行原始权重模型,在 85% 缓存命中率的单流极限状态下,推理速度可达 80-90 token/s。

以此测算,该配置每日最多可处理 1 亿输入 token 并生成 600 万输出 token。作者向社区提问:这套总成本约 9500 美元的硬件 setup 是否划算?

所属事件:DeepSeek-V4-Flash 本地部署实测:多硬件跑分与极限量化方案(14 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →