长文拆解:压缩 token 可能让 OpenAI 账单更高
KitchenAmoeba4438 · reddit · 2026-07-22
- 这篇 Reddit 长文的核心结论是:压缩 token 的工具不等于省钱,在 OpenAI API 上尤其如此。
- 作者指出,到了 GPT-5.6,cache write 的成本是普通输入的 125%,而 cache read 只要 10%;如果压缩改动了原本已缓存的前缀,反而可能比复用缓存更贵。
- 文章给出的经验阈值是:一次改动至少要删掉 92% 以上 被失效的后缀,下一次请求才可能回本。
- 对 RTK 的分析认为,它看到的“省了多少 token”并不等于真实账单,因为它看不到 API 计费、cache state 和 breakpoint;作者提到的独立 benchmark 里,RTK 虽然声称节省了 9620 万 tokens,但实际账单却 上涨了 7.6%。
- 对 Headroom 的判断更复杂:它理论上能代理真实请求、只压缩新工具输出,但当前实现似乎还跟不上 GPT-5.6 的显式 breakpoint 和写入溢价,账单面板不宜直接当作真实成本账。
- 文章最后强调,真正要看的是 每次成功任务的成本,而不是工具页面上的 token 数。
「Infra」频道最新
- WSJ:英伟达商谈为 OpenAI 数据中心计划提供约 2500 亿美元背书 — KateClarkTweets · 2026-07-27
- YC 演讲谈 BCI × AI:真正决定速度的是基础设施 — garrytan · 2026-07-27
- 13B 模型靠 SSD 分页在无独显电脑上离线跑通 — ID_R_McGregor · 2026-07-27
- llama.cpp 提醒:旧版 GGUF 在新改动后必须重生成 — EconomySerious · 2026-07-27
- 5090 本地测试:80k 上下文下 Qwen Q6 速度掉到 15 tok/s — LFAdvice7984 · 2026-07-27
- Ubuntu 部署惊艳实测:5090 显卡成最易配置的 AI 设备 — _xjdr · 2026-07-27