本地搭 LLM 评测框架,客服场景里最容易暴露回归
Product_Enthusiast24 · reddit · 2026-07-25
作者为了学习 LLM 评测系统 的工作方式,自己搭了一个本地 eval harness。
这个项目在测什么
- 用虚构客服数据和 mock 场景做测试域
- 评估维度包括:政策遵循、回答准确性、上下文 grounding、回归问题
- 还专门用“文档里没有答案”的查询来检查幻觉和拒答能力
这个 harness 怎么搭
- 通过 Ollama 和本地 API endpoint 接入本地模型
- 在 prompt 迭代阶段反复跑自动化测试,成本接近于零
- 用 Streamlit 做指标可视化、运行历史回看、失败样本并排比较,而不是只看终端 JSON
作者的收获
他发现:修一个边缘 case 的 system prompt,常常会把原先通过的测试点带坏。帖子的最后也在问:这种本地 eval 方案到了生产环境会怎么变。
「编程与Agent」频道最新
- AI苦战33小时证费马大定理,遭OpenAI强行阻断 — MikePFrank · 2026-07-25
- Vjeux:让 agent 复盘会话很有用,但全自动修复闭环仍会失控 — Vjeux · 2026-07-25
- 模型总在变,本地 AI 评测怎么还有效 — Sufficient-Curve4753 · 2026-07-25
- AI 工程师必须掌握的 10 种 agent 评测方法 — Roger_M_Taylor · 2026-07-25
- Visa 开源可接任意模型的网络安全 harness — Roger_M_Taylor · 2026-07-25
- PixelRAG 直接截图做网页检索,文本 RAG 基线被反超 18.1% — Roger_M_Taylor · 2026-07-25