双 RTX Pro 本地推理实测:解码 150 tok/s、预填充 10K tok/s
No_Run8812 · reddit · 2026-09-17
Reddit 用户 NoRun8812 分享了升级到两张 RTX Pro 的本地 LLM 工作站体验,含完整配置与踩坑记录。
- 装机耗时 2.5 天:其中一块 GPU 接 PSU 供电不足,需逐根重接线排查;后因温度过高、风扇异响又开箱处理。
- 性能:解码约 150 tok/s,预填充 10K tok/s;对比之下他认为 M3 Ultra 512GB 跑 LLM 推理太慢、不实用。
- 运行模型:Qwen 3.8 flash next 8-bit 与 DeepSeek V4 flash 0731(官方版);抱怨 Qwen 思考 token 吃掉大量上下文与显存,偏爱 DeepSeek 的 1M 上下文,可留 4 路并发。
- 开启项:GPU 间 P2P 通信、CUDA Graph、张量并行,双卡限功率 500W。
- 软件栈:openclaw、opencode、Open WebUI + Tailscale,目标是替代月费订阅与每周用量限制。
- 作者在评论区询问:Qwen 排除思考 token 后上下文是否影响准确性,以及推荐安装什么。
「编程与Agent」频道最新
- 开发者用 AI 六天做出可玩对战游戏,旧 SC2 模组重生 — pvncher · 2026-09-17
- Typesafe AI 发布 Jev:毫秒级决策路由评分模型,已上线 Vercel AI Gateway — cramforce · 2026-09-17
- typesafeai 的 Jev 分类器上线 AI Gateway,支持零数据保留 — cramforce · 2026-09-17
- 逆向视角:2.1.274 提示词 token 降 20%,system 提示占比反升至 47% — ClaudeCodeLog · 2026-09-17
- Claude Code 2.1.274 完整更新日志:MCP 等待超时、OTel 埋点全解析 — ClaudeCodeLog · 2026-09-17
- Claude Code 2.1.274 发布:一次更新 108 项 CLI 改动 — ClaudeCodeLog · 2026-09-17