UT Austin 3.5 万次实验:为省 token 压缩上下文,可能让 agent 慢 20%~80%
omarsar0 · x · 2026-10-05
UT Austin 一项关于编码 agent 上下文压缩的研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次 agent run,分别变动三个决策:如何压缩上下文、何时触发压缩、压缩多少。
关键发现:
- 省 token ≠ 省时间:Terminal-Bench 上用 Qwen 时,只用约 1/3 token 的压缩策略反而比保留全部上下文慢 20%80%
- 触发方式取舍:按步数触发的策略每步省 token 最多,但要多 10%27% 的模型调用;阈值触发省 22%55% token,调用次数接近全上下文
- 策略不能跨模型复用:对 Qwen 有效的策略套在 Devstral 上会掉到 38.7% 且变慢
作者提醒:如果压缩策略只为砍 token 而调,可能正在拖慢你的 agent,延迟要实测。
「编程与Agent」频道最新
- Ponytail 冲上 15 万星:让编码智能体别过度设计 — we93 · 2026-10-05
- 开发者预测:厂商将围堵 MCP,agent 间通信时代将至 — JosephJacks_ · 2026-10-05
- 实测发现 Dots 与 Muse 虚拟浏览器无法缩至移动端尺寸 — pkragthorpe · 2026-10-05
- 开源 Skills 编排实战:6 个技能跑测试修复流水线,DeepSeek 一周仅花 $3 — Own-Awareness8037 · 2026-10-05
- fastapi-gql-mcp:用 GraphQL 固定 MCP 工具面,省下万级 token 目录开销 — tangkikodo · 2026-10-05
- 腾讯混元 RSR 框架:27B 模型 Terminal-Bench 2 pass@3 从 57% 提至 74% — Tencent-Hunyuan · 2026-10-05