Xberg v1 发布:支持 468 种格式的 Rust 内容智能框架
Goldziher · reddit · 2026-08-02
内容智能提取框架 Xberg v1 正式发布(前身为 Kreuzberg)。该框架主打高性能与广覆盖,支持 101 种文档格式和 367 种代码/数据格式。
核心特性与技术升级:
- 引擎与解析:采用纯 Rust 编写的 PDF 后端替代 pdfium,集成 ONNX 布局检测以重建阅读顺序,并支持原生 PaddleOCR 与 Tesseract。
- 全模态处理:支持音视频转录(Whisper ONNX 引擎)、URL 抓取(含 JS 渲染),以及基于纯 Rust Candle 栈的 OCR/VLM 推理。
- 检索与智能:内置 SPLADE 稀疏嵌入、ColBERT 检索、交叉编码器重排,以及实体识别(GLiNER2)和结构化 LLM 提取。
- 跨平台支持:提供 15 种语言绑定,通过 tract 实现无 ONNX Runtime 的推理路径,全面支持浏览器(WASM)与移动端(iOS/Android)。
所属事件:Xberg 发布本地 Agent 文档提取框架(4 条相关)→
「编程与Agent」频道最新
- 利用浏览器开发者工具快速将任意网站转为 API 或 MCP 服务 — dsp_ · 2026-08-04
- Anthropic 工程师演示多智能体循环:40 分钟从零构建完整应用 — mathemagie · 2026-08-04
- 生产环境跑 Agent 一年复盘:可控审计比模型能力更重要 — KimLikeJ · 2026-08-04
- 开源项目 The Librarian:用 MCP 服务器管理 3000 个技能,节省 token 并自动优化 — Open-Appeal-9747 · 2026-08-04
- DSPy 推出实验性功能 Flex:可自动优化代码与控制流 — lateinteraction · 2026-08-04
- OpenAI 暗示下一代模型需更强算力,Codex 或向云端智能体演进 — haider1 · 2026-08-04