Meta 发布 WildArtifactBench 评估多模态 Agent
AIatMeta · x · 2026-08-21
Meta 预览了内部评估框架 WildArtifactBench,旨在评估 Agent 在跨多种交付格式的复杂现实世界任务中的表现。该框架使用人类和 Agent 偏好判断的胜率和 Elo 分数,而非严格的真值标准,从而扩展了实用多模态工作流的任务覆盖范围。Meta 正在发布 WildArtifactBench 中的 10 个任务,以衡量多模态 Agent 交付的实际实用价值。
「研究」频道最新
- MIT 研究用 AI 筛选催化材料,推动绿色氨生产 — nordicinst · 2026-08-21
- 探讨理解模型“理由”的研究议程 — brwilder · 2026-08-21
- 首个设计领域 computer-use 数据集开源:3400+ 条 Figma 真实操作轨迹 — CShorten30 · 2026-08-21
- Monroe 分子基础模型支持上下文概率推理 — chaumian · 2026-08-21
- Geoffrey Irving:Lean4Lean 验证内核正确性后可进行激进的性能优化 — geoffreyirving · 2026-08-21
- SnorkelAI 专家:扩展专家监督是前沿数据的瓶颈 — ShayneRedford · 2026-08-21