开源项目 brier:让 1B 小模型零微调输出校准概率,准确率提升 4 倍
Spirited_Conference9 · reddit · 2026-10-03
开源工具 brier 让你自托管的开源模型也能像 TypeSafe 的闭源决策模型 Jev 一样,输出带校准概率的类型化决策(如分派团队、是否退款、紧急度 1-5),无需文本解析。核心问题是开源模型原始 token 概率严重依赖选项位置且校准差——Falcon3-1B-Base 在 20 选项问题中反转选项顺序后 99% 会改答案。
brier 直接从 next-token log-probabilities 读取分布,分三级修正:
- L0(零标注):对所有选项轮转求平均 + 可选无标注先验;
- L1(50+ 标注):单温度缩放,使置信度匹配准确率;
- L2(60+ 标注):在隐藏层加一个线性头(CPU 上几秒训练,LLM 保持冻结)。
banking20 基准(20 意图、2,603 条测试消息):零标注即可把 Falcon3-1B-Base 从 16% 提到 60%,LFM2-1.2B 从 20% 到 62%;300 条标注下六个家族全部达到 80-86%(Phi-4-mini 最高 0.86);Qwen3-1.7B 的 ECE 从 0.357 降到 0.035。
已测试 15 个模型(含 2 个 MoE 和 2 个无 chat 模板的 base 模型),提供 brier check 预检命令、免费 Colab 教程和 10 分钟添加新模型的 PR 流程。局限:仅一个基准任务、transformers 后端(暂不支持 vLLM)、L0 需 K 次前向。
「研究」频道最新
- 单条 prompt 让 AI 五分钟内自动发现并验证连续介质力学新模型 — CatAstro_Piyush · 2026-10-04
- EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4% — geoffwolfe · 2026-10-04
- 指数族的 KL 散度等价于 Bregman 散度的理论笔记 — FrnkNlsn · 2026-10-04
- NeuroAgent 通过斑马鱼全脑图灵测试,覆盖约 13 万神经元 — aran_nayebi · 2026-10-04
- UTDallas 智能机器人实验室转向:从感知研究押注可泛化的机器人操作学习 — YuXiang_IRVL · 2026-10-04
- generativist 重读 Chris Olah 信息论长文:看清「可解释性鸿沟」 — generativist · 2026-10-04