复用生产数据:零成本构建 LLM 评测基准的工程实践
brucekent85 · reddit · 2026-08-14
文章介绍了一种低成本验证新模型(如 DeepSeek V4 Flash)能否替代旧模型的评测工作流。
核心思路:直接复用生产环境中记录的真实请求(包含 Prompt、配置和原始响应)作为基准数据,无需人工构建测试集。
评测流程:
- 结构化校验(免费):先用代码检查 JSON 有效性、Schema 匹配度和语言漂移。尽早过滤掉格式损坏的输出,避免浪费 LLM Judge 费用。
- 盲测 LLM Judge:使用与被测模型不同厂商的模型(如用 Claude Sonnet 5 评判 Gemini 与 DeepSeek),随机打乱输出顺序,并严格基于原始系统提示词进行评分。
踩坑经验:
- 静默截断:Claude 等模型会将推理 token 计入输出上限。若 maxtokens 设置过低,模型在处理复杂边缘案例时会静默返回空结果。若此时代码吞掉错误,会导致得出虚假的 100% 通过率。建议提高 token 上限并严格校验空响应。
「编程与Agent」频道最新
- shadcn-studio:集成 AI 工具的开源 UI 组件库 — tom_doerr · 2026-08-14
- AI编程的真正分水岭:无监督生成与经验证工程 — OGMYT · 2026-08-14
- Grok Bot 被指交互存缺陷:多智能体需引入话题机制 — garrytan · 2026-08-14
- Agent长循环易静默崩溃,编排器+工作器架构破局 — CartoonistIcy9763 · 2026-08-14
- 构建自我进化的 AI 公司:闭环 Agent 追踪的三大核心要素 — garrytan · 2026-08-14
- AI 冲击传统 SaaS:开发者用周末复刻年费 3 万美元的合规工具 — claud_fuen · 2026-08-14