Anthropic:同样的 60 万 token,会“请教”的 agent 得分 89 vs 76
AI Engineer · youtube · 2026-09-14
Anthropic 平台工程负责人 Katelyn Lesse 与平台产品负责人 Angela Jiang 在 AI Engineer 演讲中挑战一个常见假设:token 是同质的,唯一值得调的杠杆就是加大预算。她们主张“给 token 分配工作”,在固定约 60 万 token 预算下做了金融分析任务实验:
- 纯执行 agent 得分 76;同一预算下部分 token 用来咨询第二个 agent(advise) 得分 89
- 三种策略原语:advising(执行者可中途向外请教)、grading(事先定义 rubric,由评分 agent 打分并让执行者迭代)、dreaming(读取执行者自身 transcript,把发现写入记忆供下次运行使用)
- 关键反直觉结论:按分析师标准重算成绩——80% 准确的损益表不是 80% 有用,而是无用(缺的成本数字无法编造),不完美的运行都算失败。此口径下纯执行基线通过率约 42%,即平均要跑约 3 次才得到一次干净答案,真实成本约 180 万 token;advise 和 grade 策略以更低成本达到同样效果
- token 效率与单次可靠性指向不同的最优策略,取决于你在优化什么
「编程与Agent」频道最新
- 开发者想让 AI 机器人自创游戏:Freebots 拟接入 GDL 框架 — Daniel_Farinax · 2026-09-14
- Weaviate 论文揭示:LLM 给数据库下命令常误用 LIKE 代替搜索 — CShorten30 · 2026-09-14
- Obsidian 电子书阅读器所用 foliate-js 开源地址公布 — vista8 · 2026-09-14
- 把 Obsidian 改造成电子书阅读器:foliate-js 技术复盘 — vista8 · 2026-09-14
- Matt Pocock:所有公司都在急招 AI 编码人才,机会在你自己 — mattpocockuk · 2026-09-14
- 红队测试公开 Agent 的速赢清单:找到边界何处失守 — njyx · 2026-09-14