开源项目 brier:让 1B 小模型零微调输出校准概率,准确率提升 4 倍

Spirited_Conference9 · reddit · 2026-10-03

开源工具 brier 让你自托管的开源模型也能像 TypeSafe 的闭源决策模型 Jev 一样,输出带校准概率的类型化决策(如分派团队、是否退款、紧急度 1-5),无需文本解析。核心问题是开源模型原始 token 概率严重依赖选项位置且校准差——Falcon3-1B-Base 在 20 选项问题中反转选项顺序后 99% 会改答案。

brier 直接从 next-token log-probabilities 读取分布,分三级修正:

banking20 基准(20 意图、2,603 条测试消息):零标注即可把 Falcon3-1B-Base 从 16% 提到 60%,LFM2-1.2B 从 20% 到 62%;300 条标注下六个家族全部达到 80-86%(Phi-4-mini 最高 0.86);Qwen3-1.7B 的 ECE 从 0.357 降到 0.035。

已测试 15 个模型(含 2 个 MoE 和 2 个无 chat 模板的 base 模型),提供 brier check 预检命令、免费 Colab 教程和 10 分钟添加新模型的 PR 流程。局限:仅一个基准任务、transformers 后端(暂不支持 vLLM)、L0 需 K 次前向。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →