Ollama 与 llama.cpp 处理同一请求相差近 8 万 token

RadianceTower · reddit · 2026-09-12

作者在用 Opencode 跑本地模型时发现 token 计数异常:Ollama 设置 85k 上下文后,Ollama 与 Opencode 双方都报告用量为 85k,并在到达上限时停止生成,数据自洽。

但换成 llama.cpp 并把上下文设为 120k 时,却报错说请求达到 164k tokens;把窗口扩到 170k 后,prompt processing 也确实处理了 164k tokens——比 Opencode 界面报告的 85k 多出近一倍。

由于 Ollama 会因达到上限而截断生成,这并非 token 被静默丢弃,说明 Ollama 与 llama.cpp 在 prompt token 的计算口径上存在重大差异。作者尚未找到原因,帖子里在征集解释。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →