Thinking Machines 揭秘:为何 temperature=0 时 LLM 推理仍不确定

JFPuget · x · 2026-10-07

Thinking Machines Lab 的 Horace He 发表博客《Defeating Nondeterminism in LLM Inference》,解释为什么 LLM 推理难以复现。

核心问题:即便把 temperature 降到 0(理论上按贪心采样应完全确定),无论 ChatGPT 这类 API 还是用 vLLM、SGLang 自建推理,同一问题的输出仍会不同。

流行假说被质疑:常见解释是「并发 + 浮点数非结合性」假设——GPU 浮点运算 (a+b)+c ≠ a+(b+c),多线程下哪个核心先完成会导致计算顺序不同,从而产生不同结果。文章将深入剖析这一解释,并探讨如何真正消除推理中的不确定性。

对依赖可复现输出的开发者和研究者来说,这是理解 LLM 推理工程的必读文章。

所属事件:温度设 0 也难保确定:LLM 推理非确定性根源被揭秘(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →