微软研究:动作策略比最终答案更能准确评估多语言智能体

dair_ai · x · 2026-08-13

微软最新研究提出,在多语言智能体评估中,传统仅对比最终答案的方法存在局限,而模型生成的动作轨迹才是衡量跨语言一致性的核心对象。

研究团队在 6 个基准测试、41 种语言下进行了 238 万次 rollout 测试。他们发现原始轨迹相似度存在五个干扰因素:短轨迹得分偏高、空轨迹得满分、无关轨迹可能偶然一致、可复现性限制了差异上限,以及同一模型用同种语言问两次可能给出不同答案。

在剔除这些干扰因素后,研究发现前沿模型在跨语言场景下,能保持约 71% 到 73% 的动作策略一致性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →