Ollama 与 llama.cpp 处理同一请求相差近 8 万 token
RadianceTower · reddit · 2026-09-12
作者在用 Opencode 跑本地模型时发现 token 计数异常:Ollama 设置 85k 上下文后,Ollama 与 Opencode 双方都报告用量为 85k,并在到达上限时停止生成,数据自洽。
但换成 llama.cpp 并把上下文设为 120k 时,却报错说请求达到 164k tokens;把窗口扩到 170k 后,prompt processing 也确实处理了 164k tokens——比 Opencode 界面报告的 85k 多出近一倍。
由于 Ollama 会因达到上限而截断生成,这并非 token 被静默丢弃,说明 Ollama 与 llama.cpp 在 prompt token 的计算口径上存在重大差异。作者尚未找到原因,帖子里在征集解释。
「编程与Agent」频道最新
- 研究:31000 次 agent 运行中 69% 出现过至少一次奖励作弊 — dair_ai · 2026-09-12
- 开发者把 Codex 搬上折叠屏手机,服务端与语音直接本机运行 — SIGKITTEN · 2026-09-12
- 开发者吐槽云 Agent 平台还在「选仓库」,Codex 早已裸跑文件系统 — willcb · 2026-09-12
- AI 生成固件直刷 STM32:一块电路板驱动双泵加电磁阀 — debreuil · 2026-09-12
- JnBrymn 力荐 Tortie:精简的 agent 驱动 IDE,会话不随进程挂掉 — JnBrymn · 2026-09-12
- 背包里藏 MacBook 用手机热点同时跑 100 个 agent — gabriel1 · 2026-09-12