至少在小规模下,Markdown 文档比向量库更适合智能体知识库
Old_Visual_6596 · reddit · 2026-07-24
作者把原本完整的向量数据库检索栈,换成了一个互相交叉链接的 Markdown 文件夹,结果在几千页文档规模下,效果反而更好,也更容易维护。
为什么更顺手
- Markdown 能保留完整概念,不会把定义在 chunk 边界上切碎。
- 出现检索错误时,可以直接打开文件看哪里写错,再修源文件,而不是盯着 cosine score 排查。
- 知识库本身就是 git 仓库,改动可 diff、可回滚、可版本化。
- 不再需要维护一个和原文不同步的“第二真相源”。
什么时候不够用
- 这不是通用答案,而是规模问题:几千份文档没问题,到了百万级仍然需要真正的向量基础设施。
- 这种做法依赖当前模型真的擅长用文件工具和 grep 去读结构化 Markdown。
作者最后在问:大家到底在什么规模上,才不得不从这种“文件为主、索引为辅”的方案退回向量数据库?
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11