20 美元微调 1.5B 小模型,敏感信息分级吊打通用 API

TrifleHopeful5418 · reddit · 2026-09-22

Jev 发布引发热议后,作者去读了其背后的两篇论文(arXiv 2503.23303、2510.01237),结论很朴素:如果输出只是一个决策,根本不需要采样 token——在 dense backbone 上加个线性头读 logits 就行。于是他在自己的真实问题上做了实验。

场景:agent 每次工具调用前,要把上下文增量分到 4 个敏感级别、15 个标签,防止刚读过客户记录的 agent 三十秒后把摘要发到公开接口。

做法:

结果:1000 条合成对抗样本上 94.6% vs Jev API 的 68.1%——但作者强调这是「领域内模型赢在自己定义的领域」,Jev 输在定义分歧而非读不懂文档。真正值得看的是错误分布:54 个错误里 50 个是过度分级(代价只是人被烦一下),仅 4 个漏判且都只差一级,T1 内容从未接近公开端;通用模型同任务有 193 个危险方向错误——这归功于非对称损失,只是一个权重张量的事。

校准最惊艳:温度缩放后 ECE 0.0185,99% 置信的 698 条全对;按置信度排序自动决策前 85%,选择性风险仅 0.47%;95% 以下置信的切片明显过自信,应进人工复核队列而非直接采信。

作者也坦列基准缺陷:测试集与训练集同源(只测生成器内泛化)、单 seed 无方差、延迟对比(38.7ms vs 418ms)主要来自本地 vs API 网络拓扑、Jev 在 15 个标签里赢 2 平 3、更该对比的其实是 Laya(421M、Apache 2.0、同源论文)。完整数据(Wilson 区间、McNemar 检验、混淆矩阵、可靠性图)见其 Medium 长文。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →