本地跑 Qwen 3.8 27B 干 8 小时长程任务:131M tokens,省下 650 美元 API 费

illgettheownerforyou · reddit · 2026-08-18

一位开发者用 DeepSeek Harness 在 Windows 客户机上跑长程 agent 任务,推理则通过局域网交给另一台 RTX Pro 6000 机器上的 NInfer,模型为 Qwen3.8-27B(NInfer groupwise-int 混合 Q4/Q5/Q6 量化,262K 上下文),所有 shell 与文件操作都留在本地。

8 小时以上长跑的硬数据:

性能瓶颈不在生成而在预填与排队:根请求 TTFT 中位数仅 0.8 秒但 p95 达 136 秒,两个 agent 抢一个推理端点时排队明显;粗算根请求预填吞吐约 12.4K prompt tok/s(含排队与前缀复用)。

按当前 API 牌价折算这次工作负载(不含缓存折扣):DeepSeek V4 Flash 约 $18.61、GPT-5.6 Luna 约 $27.26、Claude Sonnet 5 约 $270.93、Claude Opus 4.6 高达 $677.32。作者感慨长程 agent 任务的真实成本大头是重复的六位数上下文与预填,并计划接下来尝试 NInfer 的 NVFP4 量化。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →