Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He
ICML 2026
cs.AI, cs.CL, cs.DB, cs.LG
2026-02-02
KCL 与腾讯提出 DDR-Bench:不给研究问题,模型用 SQL 和 Python 自主探库并写洞察。22 个模型里仅 Claude 4.5 Sonnet 平均准确率过 40%,达到 47.7%,长程探索仍是瓶颈。
现有 agent 评测大多默认问题已经写好。模型要做的是按题执行:搜网页、写 SQL、交报告。King's College London、腾讯和 Alan Turing Institute 把这种能力叫 executional intelligence,执行型智力。一线数据分析员更常先拿到一个库,没有人告诉他该查什么。目标、假说、何时收工,都是他自己定。论文把后一种能力叫 investigatory intelligence,调查型智力。
网上的 deep research 基准把工具几乎收成搜索,报告分又常靠主观量表。LLM4DS 工作则往往在 prompt 里塞进要查什么,交互也很少超过几十步。DDR(Deep Data Research)把两根拐杖都抽掉:只给结构化数据库和 SQL/Python,不给问题、不设轮数上限。模型必须自己探索、自己写洞察、自己停。
入口只有一句极简指令,例如「开始分析 userid=2048 的用户」。脚手架是轻量 ReAct,工具经 MCP 暴露 SQL 和 Python,没有外挂规划器或记忆模块,每轮喂完整历史。模型自行停下来时交两类洞察:message-wise 是每轮当场解读,trajectory-wise 是通读整条轨迹后的总报告。
DDR-Bench 覆盖三个真实库,共 291 个任务实体、2058 条核对清单:
评估不看「报告写得好不好」。非结构化文本先被抽成可核验事实,再由 GPT-5 mini 判断模型洞察是否支撑每条事实;GLOBEM 走封闭问答。五十多名领域专家筛过:每条事实都能从库的某个可查询子集推出来。列名被改写,探索阶段模型看不到评测问题,用来压训练污染。
在样本平均与条目平均、两类洞察上取总平均,只有 Claude 4.5 Sonnet 跨过 40%,达到 47.73%。开源侧 DeepSeek-V3.2 38.80%、GLM-4.6 37.52%,已经贴上 GPT-5.2 的 37.09%。Llama 3.3-70B 只有 12.30%。这道题远未做满。
| 模型 | 总平均准确率 |
| Claude 4.5 Sonnet | 47.73% |
| DeepSeek-V3.2 | 38.80% |
| GLM-4.6 | 37.52% |
| GPT-5.2 | 37.09% |
| Llama 3.3-70B | 12.30% |
Claude 在 10-K 的 message-wise 样本准确率到 77.61%,MIMIC 只有 36.07%。逐步洞察和终稿经常对不齐:当场分析强,不等于能把整条轨迹收成一份不漏要点的报告。
把核对清单改写成明确问题后,Qwen3-Next-80B-A3B 平均从 32.59% 升到 43.21%,10-K 从 45.58% 跳到 70.55%。目标写清楚以后,底层任务大多可解;难的是自己找目标。GLOBEM 上给问题反而掉到 31.95%(自主探索 35.40%),说明出题也不保证做对。
Qwen 家族里,参数放大十倍,最终准确率提升不到 3%,加长上下文窗口也不稳定增收。激活参数更小的 Qwen3-4B 和 Qwen3-Next-3B,探索轮数和天花板反而更高。加推理预算会少轮、多想,准确率上下跳;外挂长短期记忆同样不稳,10-K 和 MIMIC 的终稿准确率还掉了。
人工标注 206 条失败清单:58% 是探索广度或深度不够,提前停,或找到相关字段却不往下挖。强模型更容易过度推理,弱模型卡在重复调试。抽样 1850 条洞察,多数模型幻觉率低于 5%,且与准确率几乎不相关。Checker 重复评测的变异系数低于 5%,与人工的宏 F1 约 90%。
如果你在做数据 agent,这篇把「会不会把题做完」和「会不会自己出题」拆开了。外挂工作流、更大参数、更长窗口,在这个最小设定里都不是主因。像样的模型会维持一种隐式规划:覆盖面和集中度都不过极端。弱模型要么扫得太窄,要么到处点一下。测试时 scaling 呈 S 形,晚段少数高信息量查询才把准确率拉上去,token 主要花在数据库回传。
对训练的提示很硬:要的是贯穿预训练和后训练的 agent 能力,不是把 ReAct 脚手架堆厚。核对清单覆盖不全,但清单外「新颖洞察」的有用性排序和准确率排序高度同向。强模型并没有靠写偏题来刷分。
核对清单由 GPT-5 mini 抽取、再用它当 checker,客观性好过纯主观量表,但仍是模型评模型。作者报了稳定性和约 90% 宏 F1,残留误差里 checker 过严(洞察没写出具体数字就被判不支持),以及少数推理对、判决错。新颖洞察只能两两比有用性,无法穷尽所有真洞察。
脚手架被刻意削薄,所以「内在策略比外挂更重要」只在这个薄设定里成立。更强的记忆、检索或多 agent 协作会不会改写排序,论文没有系统对比。三个库都是结构化加可抽事实的文本,推广到纯数值仓、流式数据或权限墙后的生产库要另说。MIMIC 里模型会根据诊断补全被 LIMIT 截断的用药列表,评测不计分,临床上危险。