332MB 文档分类小模型 BeeNara:敢说「都不匹配」
razer_psycho · reddit · 2026-09-26
开发者 razerpsycho 发布了 BeeNara——一个仅 332MB 的 ONNX 交叉编码器小模型,用于本地文档自动归类(发票、合同、信件等)。
- 解决的问题:小参数本地 LLM 在文档分类时常常不肯承认「没有合适类别」,而是强行塞进某个文件夹;而跑大模型做基础分类又太浪费。
- 核心特性:零样本(直接用文件夹名做分类,无需微调);基于 split-conformal prediction,置信度高度校准,不确定或无匹配时返回 "none fits" 并转人工审核。
- 性能:笔记本 CPU 上离线运行,单文档约 0.2–0.3 秒,无需 PyTorch/GPU;支持英德双语;在基准测试中对「正确类别缺失」文档的召回率达 96.8%。
模型和代码已发布在 Hugging Face(Kwokou/BeeNara),可独立用于 Python 项目。
「研究」频道最新
- 教授质疑新 SC2 智能体:硬 API 限制下半职业水平仍未实现 — Kangwook_Lee · 2026-09-26
- Numerai 竞赛踩坑盘点:那些悄悄拉低模型分数的错误 — matlabulous · 2026-09-26
- Zenke 实验室公布 Bernstein 会议议程:脉冲网络与替代梯度三场报告 — hisspikeness · 2026-09-26
- Michael Levin 访谈:认知并非基因专属,学习不需要基因参与 — drmichaellevin · 2026-09-26
- 新立场论文:LLM 擅长归纳演绎,缺的是溯因推理 — bibryam · 2026-09-26
- 港科大基准:最佳法律智能体 89% 轨迹仍现幻觉 — 机器之心 · 2026-09-26