为什么让 LLM 回「是/否」更快:输出 token 越少越快

tinyfool · x · 2026-09-21

tinyfool 解释 LLM 的速度机制:模型是一个 token 一个 token 逐步输出的,输出越长越慢。像 Jev 这类只需「吐一个字」的用法之所以快,是因为它把输出压缩到极少的 token——前置的推理流程省不掉,但回答本身几乎没有生成成本。同理,问 LLM 一个复杂问题它会很慢(要准备详尽长答案),而要求它只答「是/否」就快得多。这条是对「Jev 为什么快」段子(选择题实在不会就选 C)的技术注解。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →