论文 LLM-42 登 SOSP 2026:验证式投机让 LLM 推理确定性几乎零开销
tianyin_xu · x · 2026-09-30
微软研究院团队(Raja Gond、Aditya K Kamath、Ramachandran Ramjee、Ashish Panwar)的论文 LLM-42: Enabling Determinism in LLM Inference with Verified Speculation 被 SOSP 2026(9 月底,捷克布拉格)接收,论文与代码均已公开。
- 问题:同一 prompt 多次推理输出不一致,根源是浮点加法不满足结合律,叠加 dynamic batching 和 GPU kernel 归约顺序随 batch 大小变化。关掉 dynamic batching 可消除非确定性但严重损失吞吐,而改造 kernel 做到 batch-invariant 又把确定性绑死在 kernel 实现上、带来固定开销。
- 方法:借鉴投机解码思路,用「非确定性快路径解码 + 轻量验证-回滚」实现确定性:验证器按固定 shape 的归约调度重放候选 token,跨次运行保证一致的直接提交,违反确定性的回滚重算。
- 优点:大量复用现有 kernel,只对实际需要确定性的负载付代价,兼顾吞吐与确定性。
「Infra」频道最新
- Ben Lorica:AI 数据问题正转向下游——信息不缺,可用性才是瓶颈 — bigdata · 2026-09-30
- WhiteMatter:跨层共享 KV 让各层读取任意深度,省一半缓存不降性能 — INK-USC · 2026-09-30
- 本地跑 27B 模型多难?24GB 显存几乎刚好,16GB 显卡更普遍 — draginol · 2026-09-30
- Linux 7.4 驱动让 AMD Radeon 核显 AI/LLM 性能提升 18-23% — Fcking_Chuck · 2026-09-30
- HBM 市场 2027 年或达 1000 亿美元,内存供应紧张或持续至 2028 — Beth_Kindig · 2026-09-30
- 上市数据中心 CEO:全球算力短缺将持续多年,或现 GPU 断电潮 — BenBajarin · 2026-09-30