四块 P100 跑出每秒 50 token,本地推理机还要扩到六卡
Odd_Caterpillar_2994 · reddit · 2026-07-26
用 4 块 P100 组了一套本地推理系统,并计划最终在标准机箱里塞进 6 块。
- 作者贴出了整机和内部布线照片,表示已经提前测试过,确保后续扩容可行。
- 目前实际使用时的表现大约是 50 tokens/s,PP 约 530–550。
- 等另外两块 P100 到位后,会继续观察吞吐还能提升多少。
「Infra」频道最新
- PinchTab 用 12MB Go 二进制给 AI agent 做浏览器控制 — Shruti_0810 · 2026-07-26
- AI 泡沫若破裂或比互联网崩盘更痛,因为更多靠债务堆出来 — rohanpaul_ai · 2026-07-26
- 黄仁勋称科学难题从来不只是难,而是太慢 — r0ck3t23 · 2026-07-26
- 论文称 GPU collective 延迟里每微秒都很关键 — TheZachMueller · 2026-07-26
- Stage CTO 计划开源省下数千万账单的内部系统 — jackedAJ · 2026-07-26
- SmolVM 可销毁 macOS 沙箱运行时登顶 r/macOSVMs — aniketmaurya · 2026-07-26