DataSpace 基准:强模型不等于强数据 Agent

rohanpaul_ai · x · 2026-08-24

DataSpace 基准测试表明,强大的 LLM 并不自动意味着可靠的数据 Agent。测试覆盖 410 个任务,要求 Agent 整合数据库、文件、文档和视频。结果显示,最佳模型准确率仅为 66.34%。值得注意的是,固定模型后,仅改变 Agent Harness 就能让准确率从 30.98% 提升至 46.34%。主要失败点在于跨源连接和多数据类型混合,以及最终表格提交时的列错误或误解。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →