靠「并行 minibatching」这一冷门技巧,延迟降到原来的 1/10
unironictechbro · x · 2026-09-20
作者称通过一种名为 parallel minibatching(并行小批量)的少见工程手段,把延迟降低了 10 倍。帖文只有一句话,未给出具体实现细节,但点出了一个在推理服务优化中可参考的思路。
「Infra」频道最新
- 哈佛发布 6.12 亿级 LLM 推理数据集:一年 61.2 亿次生产请求全开放 — airesearch12 · 2026-09-20
- RTX 5090 重装 ComfyUI 实测:316 秒生成 15 秒 MiniMax H3 视频 — tostane · 2026-09-20
- Oracle 新墨西哥数据中心 180 亿美元贷款被降入压力区间 — GaryMarcus · 2026-09-20
- 华为首曝带 HBM 的昇腾 960DT:288GB 显存、4 PFLOPS FP4,2027 年交付 — pstAsiatech · 2026-09-20
- 传 Anthropic 训练算力强度与推理经济性落后于 OpenAI — teortaxesTex · 2026-09-20
- 6 张 V100 跑通 Qwen 3.8 Next:MTP 提速近一倍至 43 tok/s — Odd_Caterpillar_2994 · 2026-09-20