Meta 发布 WildArtifactBench 评估多模态 Agent

AIatMeta · x · 2026-08-21

Meta 预览了内部评估框架 WildArtifactBench,旨在评估 Agent 在跨多种交付格式的复杂现实世界任务中的表现。该框架使用人类和 Agent 偏好判断的胜率和 Elo 分数,而非严格的真值标准,从而扩展了实用多模态工作流的任务覆盖范围。Meta 正在发布 WildArtifactBench 中的 10 个任务,以衡量多模态 Agent 交付的实际实用价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →