微软研究:动作策略比最终答案更能准确评估多语言智能体
dair_ai · x · 2026-08-13
微软最新研究提出,在多语言智能体评估中,传统仅对比最终答案的方法存在局限,而模型生成的动作轨迹才是衡量跨语言一致性的核心对象。
研究团队在 6 个基准测试、41 种语言下进行了 238 万次 rollout 测试。他们发现原始轨迹相似度存在五个干扰因素:短轨迹得分偏高、空轨迹得满分、无关轨迹可能偶然一致、可复现性限制了差异上限,以及同一模型用同种语言问两次可能给出不同答案。
在剔除这些干扰因素后,研究发现前沿模型在跨语言场景下,能保持约 71% 到 73% 的动作策略一致性。
「编程与Agent」频道最新
- AgentLayer 推出 /cards 技能,让 Claude 实现加密转法币支付 — kleffew94 · 2026-08-13
- Dario预测一人十亿美元公司,AI+加密自营交易或成首个突破口 — templecrash · 2026-08-13
- AI 智能体沦为云厂商推销员?利益冲突引热议 — fuggleruxpin · 2026-08-13
- 本地大模型实战:OpenHands 与 LangGraph 怎么选? — Known_Equipment_5718 · 2026-08-13
- 实用技巧:用提示词让 Claude/ChatGPT 在长任务中保持实时进度面板 — majidmanzarpour · 2026-08-13
- Agentic Data Scientist:基于 Claude 与 Google ADK 的多智能体数据科学框架 — tom_doerr · 2026-08-13