智能体框架影响准确率超15%,新基准DataSpace揭示短板
omarsar0 · x · 2026-08-06
新发布的 DataSpace 基准测试专门评估数据智能体从异构工作区中生成可验证表格结果的能力。该基准包含 410 个跨语言任务,涉及 7,439 个总计 15.01 GB 的文件(涵盖 CSV、JSON、SQLite、Markdown、PDF 和视频等多种格式)。
在对 6 个最新的前沿多模态模型和 5 种主流智能体框架的测试中发现:最高准确率仅为 66.34%。研究强调,智能体框架的选择对结果影响巨大——在固定底层模型的情况下,仅更换框架就能使准确率波动 15.36 个百分点。此外,多模态证据整合和表格连接操作普遍降低了所有模型的准确率,表明该基准远未达到饱和状态。
「编程与Agent」频道最新
- Flight Intelligence MCP:基于谷歌数据的航班搜索与比价智能体工具 — modelcontextprotocol · 2026-08-06
- Blacksmith MCP:让 Claude 直接查询 CI/CD 数据与工作流日志 — modelcontextprotocol · 2026-08-06
- Gemini生图结合GPT编码,轻松打造AI视觉英雄 — RichardsonDx · 2026-08-06
- LangChain 创始人推开源智能体启动包,助力开发者掌控 AI — hwchase17 · 2026-08-06
- 实测 Cursor 新增 Grok 4.5 High:单轮 Token 消耗暴增 — NickPassig · 2026-08-06
- Muse Code实测比肩Codex与Claude — alexandr_wang · 2026-08-06