开源 Typed Evals:用类型化判分模型做可校准的 LLM 评估框架

Charming_Group_2950 · reddit · 2026-09-21

作者受近期流行的 Jev 类「系统一」判分模型启发,开源了 Typed Evals——一个用 Python 编写的 LLM/RAG/Agent 评估框架,核心卖点是校准(calibration):

项目尚处早期,GitHub 已公开(TrustifAI/typedevals),作者征集 Jev 与评估工作流方面的反馈。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →