哈佛提出 agentic data cracking,非结构化数据问答成本降 53%
Harvard · hf · 2026-09-03
哈佛团队提出 agentic data cracking,让 LLM agent 在推理非结构化数据(PDF、报告、财报电话会等)时顺带完成数据结构化,大幅降低成本。
问题:agent 每次回答都重新打开大文档找回分散证据,单问题最多消耗百万 token;若数据已结构化,同样问题可降为廉价数据库查询——在 FanOutQA 上便宜 28 倍,扇出到更多文档时差距达数量级。
方法:结构化既自适应(由观察到的查询决定何时做、提取什么)又投机(不止服务当前问题)。agent 打开文档作答时,一个 cracking 子 agent 从已加载的上下文中低边际成本分叉出来,提取有依据的结构供未来查询复用。
效果:在 FanOutQA 上每个测试问题仅扩展一条相关问题,cracking 即降低 53% 成本且保持准确率;随着运行,越来越多查询可被已积累的结构化数据直接覆盖。作者称之为面向 agentic 推理的下一代数据基础设施的第一步。
「编程与Agent」频道最新
- 60 秒在 Google Cloud 上跑 Claude Code,复用 GCP 配额与治理 — fhinkel · 2026-09-03
- 单文件 three.js 写实瀑布:完整 prompt 公开,WebGPU+TSL 实现 — majidmanzarpour · 2026-09-03
- 同 prompt 实测:fable 5.1 与 sol 5.6 三.js 瀑布生成对比 — majidmanzarpour · 2026-09-03
- 开源 Google Tasks MCP Server:14 个工具覆盖完整 API — bantronline · 2026-09-03
- Cloudflare Images 更新:支持文字栅格化与免 token 管理图片 — ritakozlov · 2026-09-03
- 换新对话就要重新交代背景,谁来管理你的 AI 上下文? — Asly97 · 2026-09-03