D-RAC 文档切块法省 95.7% token,企业 RAG 摄取成本降 78%~86%
Yellow-AI-NLP · hf · 2026-09-22
Yellow AI 团队发布 D-RAC(Document Retrieval-Aware Chunking),解决企业知识库 RAG 摄取异构文档(PDF、Word、PPT、扫描件)的痛点:规则抽取和 OCR 会破坏阅读顺序、压平表格、丢失标题层级,而完全 agentic 切块 token 成本高且有幻觉风险。
两步方案:
- 先把任意输入文档规范化为 PDF(几乎所有格式都有确定性 PDF 渲染)
- 一次多模态 LLM 调用将页面转成检索优化的 Markdown(表格改写为自含散文陈述、保留标题层级),然后按 W-RAC 流程做确定性解析成 ID 寻址单元,再由轻量 LLM 基于标识符而非文本做切块规划
在 RAG-Multi-Corpus 基准的 236 文档/795 页 PDF 子集上,72 分钟零错误完成转换与切块,产出 1748 个检索就绪块。相比用前沿 LLM 的 agentic 切块:切块阶段输出 token 减少 95.7%,成本降 77.8%(GPT-4.1 定价)到 85.6%(Gemini 2.5 Pro 定价),耗时降 75%,可线性扩展到 500+ 页文档。
「编程与Agent」频道最新
- 「2030 年所有主流软件都将被形式化验证」引发激辩:遗留债务是最大障碍 — luislamb · 2026-09-22
- 开源电脑协手 OpenMuse:一次性 Linux 桌面里替你浏览操作网页 — aniketmaurya · 2026-09-22
- 实测 16/16 vs 9/16:作者提醒警惕 benchmark,用自己数据测 — tobowers · 2026-09-22
- 接入新 LLM 供应商前要检查哪些项?工程师团队的经验清单 — Rama_Surasani_ · 2026-09-22
- 开发者亲历:AI 写产品开发快到让人难以置信 — omnivaughn · 2026-09-22
- OpenAI 案例:V7 用 Context Graph 给企业 Agent 装上长期记忆 — xiaohu · 2026-09-22