开源基准工具可安全统计 coding agent token 消耗
bestofdesp · reddit · 2026-07-28
作者开源了一个面向 coding agent token 实验的隐私安全基准 agent-token-bench,以 MIT 许可证发布。它读取本地 Codex rollout 文件,只输出数值指标,不暴露 prompts、responses、推理内容、工具参数/结果或工作区路径。
它衡量什么
- 缓存与未缓存输入的占比
- 输出与推理输出总量
- 按旧费率卡折算的信用额度消耗
- 工具调用、轮询、compaction 次数
- 每轮、每次非轮询动作的效率
- 实验前后变化
作者的说明
仓库里附带了一条匿名初步观察,但作者明确说这只是方向性结果,不是正式 A/B test。当前也在征集对计量方法、加入 Claude Code 支持、开关控制、把 Ponytail 作为独立最小化方案,以及“达到什么质量标准才算省钱”这些问题的反馈。
「编程与Agent」频道最新
- 微软开源自主 AI Agent 治理工具包 — microsoft · 2026-07-28
- 一个 Python 项目可把技术书 PDF 转成 Claude Code 技能 — virgiliojr94 · 2026-07-28
- Hugging Face 开源本地语音到语音代理框架 — huggingface · 2026-07-28
- 新 API 让智能体能实时响应现实世界事件 — jarrodwatts · 2026-07-28
- 小语种语音智能体仍普遍卡在丹麦语这关 — Normal-Working-2852 · 2026-07-28
- 没有明确成败标准时,Agent 工作流怎么调试 — film-chick · 2026-07-28