vLLM Prefill 速度碾压同类,实现原理引热议
dangerous_inference · reddit · 2026-09-02
用户反馈 vLLM 在 4x4090 系统下的 Prefill 速度远超 llama.cpp 和 ikllama,达到数千 tokens/s。质疑为何其他引擎难以复现此类速度,寻求底层技术差异解释。
「Infra」频道最新
- 美银重申 Nvidia 首选:FY28 增速 70% 是下限,估值十年最低 — firstadopter · 2026-09-03
- DGX Spark 到手第一课:装最新 CUDA 竟被厂商层层设障 — QuixiAI · 2026-09-03
- 预测:数据中心 2027、2028 连续翻倍增长,经济秩序正在重构 — abhiadesai · 2026-09-03
- DeepSeek-V4-Pro 正式版发布:1.6T 参数 MoE,开源评测 Harness 同步亮相 — DeepLearningAI · 2026-09-03
- 博通 CEO:Anthropic 与 OpenAI 大购谷歌 TPU,将成其前两大定制芯片客户 — dinabass · 2026-09-03
- Hock Tan: 电力供应已直接决定算力部署的具体时点 — BenBajarin · 2026-09-03