Meta 推出 WildArtifactBench 评估多模态 Agent

Meta 于 8 月 21 日至 22 日发布并预览了内部评估框架 WildArtifactBench,用于衡量多模态 Agent 在复杂现实世界任务中的实用性。该框架覆盖跨多种交付格式的现实任务,并采用人类与 Agent 偏好判断的胜率等指标来评估 Agent 的实际表现,为多模态 Agent 的能力评估提供了新的基准。

2026-08-21 ~ 2026-08-22 · 2 条相关

另有 1 条近重复转述:qinzytech