长对话为何越聊越贵:每轮全量重发,prefix 缓存一改就失效
ClickOk5811 · reddit · 2026-10-10
作者拆解长会话成本的真实来源:你支付的不是刚输入的那句话,而是此前全部历史每轮重发过模型一遍——第 40 轮的两行回复背着前 39 轮一起计费。屏幕上看着轻,账单算的是整条线程。
Prompt caching 能缓解,但前提是 prefix 字节级不变:一旦编辑过早期消息或措辞有丝毫漂移,编辑点之后的全部内容都是缓存 miss,对已经付过一次费的历史再付全价。更大的上下文窗口不但不解决,反而让长线程更舒适、更延长。朴素解法:任务切换时就开新会话,同任务才留在旧会话里——是否值得这个摩擦因人而异。
「模型」频道最新
- 从业者:逐模型定制可避免模型与 2D 动画风格打架 — andrew_n_carr · 2026-10-10
- repligate:现在的模型「对齐」我只会劝我早点睡觉多撸猫 — repligate · 2026-10-10
- AI 只回一个「点赞」确认请求,用户盛赞这种反啰嗦设计 — enggirlfriend · 2026-10-10
- 盲测对比:Astra 在硬核编码上 80% 胜过 Opus 5.5 — bindureddy · 2026-10-10
- Liquid AI 决策模型 d1 上线 Vercel AI Gateway,支持视觉输入 — maximelabonne · 2026-10-10
- 开源 TTS 排行榜更新:Paradee-8M 蒸馏自 Kokoro,1/10 参数持平 WER — realmrfakename · 2026-10-10