开源 RAG 评测框架 RAGnarok 发起人类标注研究:LLM 评委可信吗
Ok-Swim9349 · reddit · 2026-09-05
开源本地优先 RAG 评测框架 RAGnarok-AI 的维护者发起一项研究:当评测者本身是 LLM 时,自动化评测结果还能不能信?框架用本地 LLM judge 评估检索相关性、忠实度、答案相关性与完整性,现在作者正在构建人类标注基准来对照自动化分数,招募开发者参与标注——约 10–15 个案例、耗时 30–45 分钟,无需 RAG 专业知识,匿名进行。研究覆盖 Docker、Python、FastAPI、Kubernetes 等项目的文档,将回答三个问题:LLM judge 与人类判断的一致性、对好/坏 RAG 系统的区分度、以及测量的可复现性。方法、语料与实验协议全部公开版本化。
「研究」频道最新
- AREX-Skill 技能库将 MLE-bench 夺牌率从 31% 提至 73% — TheTuringPost · 2026-09-05
- 上海AI Lab 发布 Harness-of-Harness,70 轮迭代自主开发出 FPS 游戏 — aigclink · 2026-09-05
- Hugging Face 拆解 16 个开源 RL 库:异步解耦已成同步训练共识 — Thom_Wolf · 2026-09-05
- GRA 论文入选 CoRL 2026:合成机器人视频只该管几何,控制交给真人示教 — MikeShou1 · 2026-09-05
- RL 环境只爬单一山峰,模型各擅其长需多模型互补 — dejavucoder · 2026-09-05
- 研究:生成式 AI 已致菲律宾外包业约 25 万岗位凭空消失 — sebkrier · 2026-09-05