5400 美元 8 卡 V100 二手服务器跑 FlashAttention,27B 模型超 200 tok/s
MzCWzL · reddit · 2026-10-01
Reddit 用户分享用 5400 美元从 eBay 购入的 8x V100 服务器跑 flash-next 推理的实测:
- 仅用 4 卡时,27B 模型 TP=4 可达 >200 tok/s(dflash),prefill 约 2.5k–3.5k tok/s
- 开启图像输入时 KV cache 约可支撑 120k 上下文
- 使用 Nvidia 的 nvfp4 量化 checkpoint,借助一个可将量化权重即时解包为 fp16 的仓库(1Cat-vLLM),并对其做了深度优化
- 系统由 Claude Opus 5.5 协助完成初始化配置
「编程与Agent」频道最新
- 资深程序员:说 AI 建不出可维护架构是很 2023 的看法 — dreamwieber · 2026-10-01
- 经济学家:AI 改过的代码会失控,我的解法是设'AI 专属文件夹' — paulnovosad · 2026-10-01
- 本地模型跑 computer use 慢但能用,受监管行业怎么选? — Ambitious_Fold_2874 · 2026-10-01
- 小米 MiMo-V2.6 技术报告解读:一次 RL 混跑全领域,训练成本 260 万美元 — SergioPaniego · 2026-10-01
- 开源 Synentra 网关:按意图和风险管控 Agent 能做什么 — ziagham · 2026-10-01
- 工具一多就调用出错?Reddit 讨论让 Agent 写代码调工具的解法 — Future_AGI · 2026-10-01