至少在小规模下,Markdown 文档比向量库更适合智能体知识库
Old_Visual_6596 · reddit · 2026-07-24
作者把原本完整的向量数据库检索栈,换成了一个互相交叉链接的 Markdown 文件夹,结果在几千页文档规模下,效果反而更好,也更容易维护。
为什么更顺手
- Markdown 能保留完整概念,不会把定义在 chunk 边界上切碎。
- 出现检索错误时,可以直接打开文件看哪里写错,再修源文件,而不是盯着 cosine score 排查。
- 知识库本身就是 git 仓库,改动可 diff、可回滚、可版本化。
- 不再需要维护一个和原文不同步的“第二真相源”。
什么时候不够用
- 这不是通用答案,而是规模问题:几千份文档没问题,到了百万级仍然需要真正的向量基础设施。
- 这种做法依赖当前模型真的擅长用文件工具和 grep 去读结构化 Markdown。
作者最后在问:大家到底在什么规模上,才不得不从这种“文件为主、索引为辅”的方案退回向量数据库?
「编程与Agent」频道最新
- MCP 服务器改成按工具调用启动,能省下数百 MB 内存 — gelembjuk · 2026-07-24
- Infinitty app 为 agents 加入任务跟踪和 MCP 界面渲染 — jasonkneen · 2026-07-24
- GitHub Copilot 在复杂代码库里仍显得很没用 — SkeleMortal · 2026-07-24
- 让 AI Agent 失效的七个系统设计错误 — goyalshaliniuk · 2026-07-24
- 本地 Qwen 接入内部文档后,作者在问企业会不会买单 — teriyaki_tofu1 · 2026-07-24
- Google 课程演示 Antigravity 2.0 的并行 worktree 与冲突解决 — ksoonson · 2026-07-24