Thinking Machines 揭秘:为何 temperature=0 时 LLM 推理仍不确定
JFPuget · x · 2026-10-07
Thinking Machines Lab 的 Horace He 发表博客《Defeating Nondeterminism in LLM Inference》,解释为什么 LLM 推理难以复现。
核心问题:即便把 temperature 降到 0(理论上按贪心采样应完全确定),无论 ChatGPT 这类 API 还是用 vLLM、SGLang 自建推理,同一问题的输出仍会不同。
流行假说被质疑:常见解释是「并发 + 浮点数非结合性」假设——GPU 浮点运算 (a+b)+c ≠ a+(b+c),多线程下哪个核心先完成会导致计算顺序不同,从而产生不同结果。文章将深入剖析这一解释,并探讨如何真正消除推理中的不确定性。
对依赖可复现输出的开发者和研究者来说,这是理解 LLM 推理工程的必读文章。
所属事件:温度设 0 也难保确定:LLM 推理非确定性根源被揭秘(2 条相关)→
「Infra」频道最新
- 芬兰勒令谷歌暂停两座数据中心施工,环保评估未过关 — KyeGomezB · 2026-10-07
- Z-Image GGUF 量化实测:Q4_K+Qwen3-4B 塞进 8GB 显存 — Kordeyl · 2026-10-07
- 充电公司 Xeal 计划在美部署 10 万块英伟达 GPU,建边缘推理网络 — Nandu_alias_Parthu · 2026-10-07
- Tokio作者打造的Rust ORM Toasty全面支持Turso数据库 — glcst · 2026-10-07
- Kubernetes 之父创办 Stacklok,用云原生思路重构 coding agent 基础设施 — Latent Space · 2026-10-07
- Ollama v0.40.0上线:Apple Silicon自动启用MLX运行时 — lmoroney · 2026-10-07