开源 RAG 评测框架 RAGnarok 发起人类标注研究:LLM 评委可信吗

Ok-Swim9349 · reddit · 2026-09-05

开源本地优先 RAG 评测框架 RAGnarok-AI 的维护者发起一项研究:当评测者本身是 LLM 时,自动化评测结果还能不能信?框架用本地 LLM judge 评估检索相关性、忠实度、答案相关性与完整性,现在作者正在构建人类标注基准来对照自动化分数,招募开发者参与标注——约 10–15 个案例、耗时 30–45 分钟,无需 RAG 专业知识,匿名进行。研究覆盖 Docker、Python、FastAPI、Kubernetes 等项目的文档,将回答三个问题:LLM judge 与人类判断的一致性、对好/坏 RAG 系统的区分度、以及测量的可复现性。方法、语料与实验协议全部公开版本化。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →