实时 Agent 竞赛测泛化性,斯坦福等团队夺冠

CShorten30 · x · 2026-08-19

Databricks 在 Data + AI Summit 举办了一场独特的实时 AI 竞赛,要求研究者现场将 Agent 适配到全新基准 OfficeQA Pro V2,以测试模型在基准上的性能改进是否能泛化到新任务。最终斯坦福、UMass Amherst 和耶鲁大学团队获胜。相关博客详细介绍了获胜团队的技术思路。

所属事件:斯坦福等团队 63.3% 准确率夺 Databricks 推理杯冠军(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →