忠实度判别 148 对测试 95% 准确,Brier 0.057 但作者保持克制
mikegiannulis · x · 2026-09-18
在 148 对干净的「忠实 vs 捏造」样本上,Jev 达到 95% 准确率,Brier 分数 0.057(越低越好)。
作者克制地指出:小规模测试不能证明生产环境中的完美校准。真正有用的问题是:系统什么时候该自主行动,什么时候该交给人复核。
所属事件:小模型实测:重排与路由胜出,延迟而非账单是真收益(8 条相关)→
「编程与Agent」频道最新
- 开源面板 ServerKit 获 1.3k 星:一键管 VPS 应用与数据库 — tom_doerr · 2026-09-18
- Gary Marcus:Agent 安全没人管,它只是个会说话的未审计服务账号 — GaryMarcus · 2026-09-18
- Amp 创始人谈设计哲学:不做技巧堆砌,让模型用好简单原语 — HankYeomans · 2026-09-18
- You.com 办 AI Agentic 黑客松,挑战自进化学习智能体 — PolarBearby · 2026-09-18
- Muse Mac 版上线:可跨应用读取文件并接入 Perplexity 深度研究 — ChrisUniverse · 2026-09-18
- Stack Overflow for Agents 上线三月推 ChatGPT 插件与隐私控制 — pchandrasekar · 2026-09-18