DataSpace 基准测试:强 LLM 不等于可靠数据智能体

DataSpace 基准测试显示,拥有强大的大语言模型并不自动意味着能构建可靠的数据智能体。该测试覆盖 410 个任务,要求智能体整合数据库、CSV/JSON 文件、文档和视频等多种数据源。结果显示,最佳模型的表现也有限,最高得分仅 66%,凸显出从强模型到可靠 Agent 之间仍存在明显差距。

2026-08-24 ~ 2026-08-25 · 2 条相关