DDR-Bench 揭示 LLM 长期探索失忆症:仅靠 Agent 框架难解

青稞AI · wechat · 2026-08-24

核心问题

现有大模型评估多聚焦“执行型智能”,忽略了数据科学中更关键的“研究型智能”,即模型自主设定目标并挖掘洞察的能力。为此,论文提出了“深度数据研究(DDR)”任务与 DDR-Bench 基准。

方法创新

DDR 任务将模型投入无预设问题的原始数据库,要求其自主完成探索性分析。为解决开放式任务的评估难题,研究引入“检查清单”机制,通过核对模型报告命中预设关键事实的程度进行客观打分。

关键发现

实验揭示了前沿模型的“长期探索失忆症”:

结论与建议

研究证实,仅靠外部 Agent 框架无法根治上述瓶颈。实现真正的“研究型智能”必须升级模型内在机制,如引入好奇心驱动的强化学习。该基准的评估范式极具借鉴价值,建议在最新旗舰模型上复现验证。

论文链接

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →