Anthropic 官方省钱指南中一招反致成本高出 74%
Brinvik · reddit · 2026-09-10
Anthropic 上周发布的成本优化指南里,有一项「上下文编辑与压缩」在 20 个 issue 的短任务上没省到钱,反而多花了 74%;但在更长的任务里同样这招省了 39% 和 32%——同一杠杆符号相反,决定变量是任务长度。作者据此指出:这份清单本质是对自己工作负载的一组赌注,动手改之前必须先测量。
指南中其余 Anthropic 自测数据:
- 为 Opus 4.8 写的 prompt 在 Opus 5 上每个支持工单成本高出 36%,准确率无提升;仅删掉「verify twice」一句就把 Opus 5 单工单成本降了约三分之一。
- Agent 循环全天真实流量下中位 84% 的输入读自缓存,表现最好的 10% 设置达 94% 以上。
- 缓存使其基准上 agent 循环成本降至 1/2.7 到 1/5.3。
- 不暂停情况下,Sonnet 5 上五分钟缓存默认比一小时档便宜 15%,Opus 5 上便宜 11%,更长的缓存反而更贵。
作者另提醒两处基线不一致:36% 是 Opus 4.8 对 Opus 5 不改 prompt 的对比,14% 审计数据是 Opus 5 上有审计 vs 无审计,两者不可直接比较;而恢复准确率的手段(弃用的 thinking 设置、矛盾规则、手写 scratchpad)移除后各损失 7-11 个百分点,影响比多数成本杠杆更大。作者还询问是否有人实测过自己的缓存命中率。
「编程与Agent」频道最新
- 「Devin 跑自动化 UI 测试像 AGI」:自动建计划、点 UI、录视频一步到位 — smtabatabaie · 2026-09-10
- Qwen Code Desktop v0.3.0 发布:修复会话恢复与 Windows PTY 问题 — github-actions[bot] · 2026-09-10
- Hermes Agent 支持从私有仓库安装插件,自动复用 GitHub 凭据 — Teknium · 2026-09-10
- Salesforce 论文:先演化 harness 再微调,弱模型七项任务全线下滑 — omarsar0 · 2026-09-10
- 「我们要的是思维的自行车,得到的却是思考的 DoorDash」 — round · 2026-09-10
- 20 年剪辑老兵实测:GPT-6 Astra 经 MCP 直连 DaVinci 剪片 — petewoodbridge · 2026-09-10