19 个用例×6 模型×3 轮实测:最新模型升级未必更好用
ChanceKelch · x · 2026-10-01
Flock Synthetics 创始人 Chance Kelch 分享的一次模型评测实践——用自建 fixture 库对新模型升级做严格对比,结论是"最新不等于更好":
- 评测设计:选取 19 个有代表性的测试用例(fixture),涵盖真实 App 场景与人为构造的反例,每个 fixture 记录了它应暴露的缺陷,并混入不应报警的正常样本;6 个模型各跑 3 轮,喂给它们相同的已录证据,测的是"解读证据找对问题"的能力
- 关键 bug:一个表单声称所有字段可选、却因"可选"字段为空而禁用提交按钮。GPT-6 Luna 发现了文案混乱,却漏掉了这个真正阻断流程的缺陷;反倒是被测的最老模型 GPT-4.1 在这个用例上得分最高
- 平均分掩盖取舍:GPT-5.6 Luna 平均质量分最高,GPT-6 Luna 最便宜,GPT-6 Sol 跨轮次最稳定——但没有一个新模型在平均分上胜过旧版 Luna
- 核心论点:换模型的决定应取决于具体任务、prompt 和工作流,以及提升能否在重复运行中复现;平均分高不等于没有不可接受的失误
作者正在做的是用 AI 测试产品/应用、找出用户困惑点的事业,这篇是典型的 eval 工程第一手复盘。
「编程与Agent」频道最新
- 新工具支持对各种 factory 配置直接跑基准测试 — vikvang1 · 2026-10-01
- 推理引擎 Magnitude 登顶 HN:本地跑开源模型比 llama.cpp 快至 2 倍 — nickbaumann_ · 2026-10-01
- marimo 推出 marimo-lens:圈选图表直接指挥 agent 改代码 — S_Conradi · 2026-10-01
- 非程序员用 Claude 做 MCP 贸易游戏:13 篇设计文档加 200 条决策日志 — Wainfare · 2026-10-01
- 用户吐槽 Claude Code 的 Opus 忘参数,梗图致敬《老无所依》 — firasd · 2026-10-01
- 个人微调 Qwen3.8-27B-pi:修复推理力度乱序,省 41% token — victormustar · 2026-10-01