答案对了评测也可能无效:微软提醒 agent 评测要管好沙盒
WirelessLife · x · 2026-09-18
微软开发者博客文章指出,AI 编码 agent 的评测得分可能测错了东西:答案正确不等于测量有效。Agent 可能凭内部知识作答,也可能从 prompt、本地源码、缓存、工具或服务中检索到答案——每条路径体现的是不同能力,而最终答案几乎无法暴露 agent 走了哪条路。文章给出的核心方法论:
- 先定义测量目标:在限制任何工具之前,先明确评测要证明什么——是测试模型能否研究陌生 API,还是能否利用仓库里的文件,抑或模型本身已了解某产品。
- 沙盒要屏蔽被测知识:如果评测目的是检验模型「知道什么」,沙盒必须阻止 agent 检索到被测知识,否则分数只反映运行期间 agent 能接触到的一切。
- 检查意外通过:看似惊艳的 pass 可能只是检索而非知识,值得逐个核查。
结论:agent 评测的上限取决于沙盒设计,否则看起来 impressive 的分数回答的其实是另一个问题。
「编程与Agent」频道最新
- Claude Code 2.1.275 版本即将发布 — ClaudeCodeLog · 2026-09-18
- 法律 AI 公司 Legora:没有最好的模型,只有每项任务跑分胜出者 — soleio · 2026-09-18
- AI 安全监控公司 Raindrop 融资 5000 万美元,推智能体仿真产品 — soleio · 2026-09-18
- 用智能体做研究的反思与经验:一篇实践复盘 — _xiang_chen_ · 2026-09-18
- Addy Osmani 谈老旧代码库的 Agentic 工程:让隐性约束显形 — rseroter · 2026-09-18
- 谷歌Stellar Colosseum:多智能体协作 harness 证明数学新定理 — IgorCarron · 2026-09-18