Spotify 用廉价模型分流大文件读取,Claude Code token 用量降 90%

aliscodes · x · 2026-09-07

Spotify 工程团队发文介绍其 Claude Code 省钱方案:大部分 agent 工作其实是 I/O——读文件、按模板生成测试、更新文档,这些都被喂给了贵得离谱的前沿模型。他们的解法是一个叫 shunt 的插件,用两个廉价模型(示例用 Gemini 2.5 Flash)接管脏活:

关键经验:用 hook 而不是指令。他们最初把规则写进 claude.md 让 Claude 用廉价模型,结果 Claude 无视规则照读不误;于是改为系统级拦截——超过 350 行的文件读取一律被阻断并路由给 bulk-reader,cat/head/tail 读大文件也被拦,但带 offset 的局部读取放行(那是真实编辑需要)。

效果与代价:在 16.2 万行的 Java 仓库上,三次 bulk-read 测试使进入 Claude 的上下文分别减少 82%、94%、94%(注意省的是进入 Claude 的 token,不是总账单)。贵模型只负责编辑、bug、架构和安全关键问题——有一次廉价 worker 漏掉线程安全问题,Claude 拿到正确片段后立刻抓了出来。每次交接增加 10-30 秒,小文件不值得路由。

作者还给出无插件的轻量版做法:让廉价模型通读长文档回传要点,再把要点+一段粘贴的原文切片交给贵模型。

所属事件:Spotify 插件拦截大文件读取,Claude Code token 开销降九成(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →