哈佛提出 agentic data cracking,非结构化数据问答成本降 53%

Harvard · hf · 2026-09-03

哈佛团队提出 agentic data cracking,让 LLM agent 在推理非结构化数据(PDF、报告、财报电话会等)时顺带完成数据结构化,大幅降低成本。

问题:agent 每次回答都重新打开大文档找回分散证据,单问题最多消耗百万 token;若数据已结构化,同样问题可降为廉价数据库查询——在 FanOutQA 上便宜 28 倍,扇出到更多文档时差距达数量级。

方法:结构化既自适应(由观察到的查询决定何时做、提取什么)又投机(不止服务当前问题)。agent 打开文档作答时,一个 cracking 子 agent 从已加载的上下文中低边际成本分叉出来,提取有依据的结构供未来查询复用。

效果:在 FanOutQA 上每个测试问题仅扩展一条相关问题,cracking 即降低 53% 成本且保持准确率;随着运行,越来越多查询可被已积累的结构化数据直接覆盖。作者称之为面向 agentic 推理的下一代数据基础设施的第一步。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →