开源 Typed Evals:用类型化判分模型做可校准的 LLM 评估框架
Charming_Group_2950 · reddit · 2026-09-21
作者受近期流行的 Jev 类「系统一」判分模型启发,开源了 Typed Evals——一个用 Python 编写的 LLM/RAG/Agent 评估框架,核心卖点是校准(calibration):
- 支持 LLM 回复评估、RAG 评估、Agent 与工具调用轨迹评估
- 用人工标注样本对每个指标拟合校准曲线,使 Jev 打出的 0.8 分对齐真实人工通过率,而非拍脑袋定阈值
- 流程:人工标注 → Jev 打分 → 按指标拟合校准 → 留出集验证 → 复用校准后的评估器
- 支持异步/批量评估、自定义 judge 后端,提供 LangChain、CrewAI、Microsoft Agent Framework 集成,核心保持框架无关
项目尚处早期,GitHub 已公开(TrustifAI/typedevals),作者征集 Jev 与评估工作流方面的反馈。
「编程与Agent」频道最新
- 开发者激辩:代码审查自动化后,新手还该不该学编程 — mgill25 · 2026-09-21
- 老手带新手 vibecoding 感悟:沟通与系统思维才是关键 — eschadiol · 2026-09-21
- Substrate:快速挂起恢复架构,让 agent 循环成为新调度循环 — rakyll · 2026-09-21
- 把长时编码 agent 排满周末:出门玩,活照干 — josh_bickett · 2026-09-21
- 观点:mac mini 买家愿花同价钱为云端常驻 Codex/Claude Code — alliekmiller · 2026-09-21
- Refero Styles 将 2000+ 真实产品设计系统转成 DESIGN.md,免费开放 — victor_explore · 2026-09-21