数据不出楼的 LLM 栈:最易漏的泄漏点在 OCR 和评测环节
lucasbennett_1 · reddit · 2026-09-30
作者分享了搭建「数据不能离开大楼」的全本地 LLM 栈的经验:本地跑模型不难,难的是第三方集成带来的泄漏——一个不经意的 HTTP 调用(云 API、托管评测 judge、tracing SaaS、embedding 服务)就让 on-prem 名存实亡。
已经本地化的部分:
- 运行时:llama.cpp / vLLM / Ollama
- 模型:按硬件选 Qwen 或 Llama 系
- 向量库:pgvector 或 Qdrant
容易被忽视的泄漏点:
- 文档解析/OCR:PDF 与扫描件进 chunking 前常需要解析,团队习惯性调用云解析器而破规——可用 LiteParse 等开源解析器或 HF 上的开源方案保持本地
- 评测:本地部署仍常把 prompt 和输出发给托管 judge 或 tracing 面板——同样的泄漏只是换了形式;可改用本地评分集或本地 judge 模型,tracing 自托管
作者征集其他人 100% 本地端到端栈的做法。
「Infra」频道最新
- 不换模型也能省 AI 账单:五招优化 LLM 使用成本 — goyalshaliniuk · 2026-09-30
- DeepSeek 转用华为昇腾 950 训练模型 — WebAssemblyMan · 2026-09-30
- FreeToken 开源:消费级硬件本地跑 290B+ MoE 模型 — tom_doerr · 2026-09-30
- EnerTune 登 SOSP'26:推理能耗较 SOTA 降低 1.4–2.3 倍 — tianyin_xu · 2026-09-30
- SOSP'26 论文:面向能耗的 GPU 共享方案,重思推理服务利用率 — tianyin_xu · 2026-09-30
- SOSP'26 两篇系统论文:AI Agent 隔离数据流与 CXL 共享内存索引 — tianyin_xu · 2026-09-30