evalstats v0.2.6 发布:小样本也能获得精准统计
IanArawjo · x · 2026-08-29
evalstats v0.2.6 版本发布。新版本的 compare() 方法解决了 AI 评估中的统计校准问题,即使在小样本量或依赖 LLM 评委(少量人工标注)的情况下,也能产生可信的统计数据。项目主页展示了最终的校准曲线。
「编程与Agent」频道最新
- Browser Use 发布 iMessage 网页智能体 — _AustinCalvert_ · 2026-08-29
- AgentHeights:打造人机协作的虚拟办公室 — edgarpavlovsky · 2026-08-29
- 从单屏识别到多步操作:医疗 AI Agent 的 7 步构建路线图 — MaryamMiradi · 2026-08-29
- Prime Agent 发布:支持自我改进的 RLM 编程框架 — xeophon · 2026-08-29
- 构建生产级 Agent:Hermes 架构与关键遥测实践 — gregmushen · 2026-08-29
- Agent 互操作性平台支持接入各类主流 AI Agent — Daniel_Farinax · 2026-08-29