Reddit 讨论:RAG 评估比搭系统本身更难
nighthawk2906 · reddit · 2026-07-29
一位 Reddit 用户分享:做完 RAG 系统后,评估反而成了最难的部分。
- 检索和 LLM 集成本身都顺利,但一到评估就卡住了。
- BLEU、ROUGE 这类传统指标对开放式回答几乎没用;LLM-as-judge 又可能偏向自己当裁判的模型。
- 他现在每天手工看大约 50 条答案,想知道大家在没有清晰标准答案时怎么做 RAG 评估。
「编程与Agent」频道最新
- Claude Opus 5 据称做出了《Sea of Thieves》克隆游戏 — ChrisGPT · 2026-07-29
- Agent 循环会把评测集悄悄变成训练数据 — Vegetable-Rub-8241 · 2026-07-29
- Hermes Agent 改用流式 TTS,语音对话更接近实时 — Teknium · 2026-07-29
- GitHub 整理 100+ 个 LLM 应用、RAG 和 Agent 工具 — tom_doerr · 2026-07-29
- Claude 和 Codex 开源项目估值约 7.8 万美元 — rudrank · 2026-07-29
- 为什么评测全过的 AI agent 到了生产还会漂移 — Diligent_Response_30 · 2026-07-29