「只看钱和时间」:tokens 与 turns 是无用的人造评测指标
xeophon · x · 2026-09-17
- xeophon 总结其观点:token 数和 turn 数都是人造、难以测量且近乎无用的指标;真实世界里 agent 评测只应关心两件事——花费的金额和 wall clock 时间。
- 其具体做法是给评测设极长的时间上限兜底(Terminal-Bench 4.0 为 8 小时,24 小时可能更好),而不是限制 turn/token;此前讨论中还涉及 turn 定义难题与基建公平性问题。
所属事件:Agent 评测指标之争:该看 token 与轮次,还是只看钱和时间(3 条相关)→
「编程与Agent」频道最新
- 把简单请求路由到便宜模型后,总账单反而更高了 — Massive_Tell_4276 · 2026-09-17
- 只读分析 agent 用 Flash Lite:缓存命中率仅 2.2%,成本全公开 — RedaHaloubi · 2026-09-17
- Codex 应用 /side 侧聊太好用,作者绑定到 ⌘S — alex_frantic · 2026-09-17
- 从个人第二大脑到团队大脑:一张表加 MCP 权限层怎么做 — Cole Medin · 2026-09-17
- AI SDK 新增 evaluate 方法接入 Typesafe AI 最新 Jev 模型 — cramforce · 2026-09-17
- BotBell MCP:让 AI 助手能给 iPhone 和 Mac 推通知 — modelcontextprotocol · 2026-09-17