本地跑 Qwen 3.8 27B 干 8 小时长程任务:131M tokens,省下 650 美元 API 费
illgettheownerforyou · reddit · 2026-08-18
一位开发者用 DeepSeek Harness 在 Windows 客户机上跑长程 agent 任务,推理则通过局域网交给另一台 RTX Pro 6000 机器上的 NInfer,模型为 Qwen3.8-27B(NInfer groupwise-int 混合 Q4/Q5/Q6 量化,262K 上下文),所有 shell 与文件操作都留在本地。
8 小时以上长跑的硬数据:
- 966 次模型调用,任务输入 1.302 亿 tokens、输出 81.25 万 tokens(含压缩后输入 1.312 亿)
- 972 次模型侧工具调用、1421 次本地工具操作,仅 30 次失败(错误率 2.11%)
- 31 次自动上下文压缩,中位根请求 136.6K tokens,p95 达 205.9K,最大 231.2K
- 加权解码速度 104.83 tok/s,零模型生成失败
性能瓶颈不在生成而在预填与排队:根请求 TTFT 中位数仅 0.8 秒但 p95 达 136 秒,两个 agent 抢一个推理端点时排队明显;粗算根请求预填吞吐约 12.4K prompt tok/s(含排队与前缀复用)。
按当前 API 牌价折算这次工作负载(不含缓存折扣):DeepSeek V4 Flash 约 $18.61、GPT-5.6 Luna 约 $27.26、Claude Sonnet 5 约 $270.93、Claude Opus 4.6 高达 $677.32。作者感慨长程 agent 任务的真实成本大头是重复的六位数上下文与预填,并计划接下来尝试 NInfer 的 NVFP4 量化。
「编程与Agent」频道最新
- PE 案例复盘:Agent 处理医保单前先做数据映射 — alex_verem · 2026-08-18
- CLAUDE.md 写错代码总乱跑?配置避坑指南 — socialwithaayan · 2026-08-18
- 用户询问 Codex 中多个子代理图标的含义 — lucasmeijer · 2026-08-18
- 用Obsidian做个人Agent知识库与检索实践 — hugobowne · 2026-08-18
- Agent 记忆架构解密:基于 Obsidian 的高效检索实践 — hugobowne · 2026-08-18
- 开源项目:WhatsApp 语音消息实时转文字 Chrome 插件 — ___Mufasaa · 2026-08-18