0.6B 开源模型 Eve 通过校准测试:自报 90% 即可信
colinmcnamara · x · 2026-09-24
校准评测结论之一:0.6B 的开源模型 Eve 勉强通过测试——1599 道题中 115 道达到 90% 置信,673 道错题中仅 12 道自称 90%,即当它说「90% 确定」时基本可信。同线程还测了托管决策 API Jev:保留的难题上 96% 正确、无需 GPU,但非确定性,且人工标注下三分之一的错题仍自称 90%。
所属事件:小模型校准实测:Kev-9b 错题常自报九成把握(2 条相关)→
「编程与Agent」频道最新
- Vercel Sandbox 推出 Drives 持久存储:单盘最大 16 TiB — cramforce · 2026-09-24
- rauchg 拆解成功 Agent 三要素:大脑、双手与文件,云端需解耦 — cramforce · 2026-09-24
- 开源工具 hallpass:在工具调用前实时校验 Agent 权限,防越权 — Adorable-Algae6903 · 2026-09-24
- 开发者发布小巧工具:检测外部 agent 是否潜入你的电脑 — BLUECOW009 · 2026-09-24
- 用户口述 5 分钟,Claude Opus 5.5 自主跑 12 小时出成品 — banteg · 2026-09-24
- 本地 Agent 逃逸可控制整机,云端 Agent 只拿到空租户 — HankYeomans · 2026-09-24