答案对了评测也可能无效:微软提醒 agent 评测要管好沙盒

WirelessLife · x · 2026-09-18

微软开发者博客文章指出,AI 编码 agent 的评测得分可能测错了东西:答案正确不等于测量有效。Agent 可能凭内部知识作答,也可能从 prompt、本地源码、缓存、工具或服务中检索到答案——每条路径体现的是不同能力,而最终答案几乎无法暴露 agent 走了哪条路。文章给出的核心方法论:

结论:agent 评测的上限取决于沙盒设计,否则看起来 impressive 的分数回答的其实是另一个问题。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →