小型模型自写测试当关卡:77% 的测试误杀正确代码
deadatreides1 · reddit · 2026-10-05
Reddit 用户对「模型自写测试+自动修复」流水线做了一次少有人做的检查:四个本地 GGUF 小模型(qwen3-1.7b、qwen2.5-coder-1.5b、llama-3.2-1b、smollm2-360m)、6 个任务、785 次调用,把每套生成的测试喂给已知正确的参考解,结果 168 套中 129 套(77%)拒绝了正确答案。关键发现:
- 测试并不「偷懒」:平均突变分数 0.965,能抓出几乎所有机械性破坏版本;满分 1.0 的测试套件中仍有 81% 误杀正确代码——彻底、自信,但测错了规格。
- 典型案例:元音计数任务里,代码漏了大写、测试也只数小写,双双「PASS」,修复环节从未触发;一个手写的 "HELLO" 测试才能抓住。
- 67 次修复调用中 50 次是在修「本来就对」的代码,17 个真 bug 只修好 1 个。
- 代码本身不弱:单次采样解出 0.833,pass@8 达 0.958;相近 token 预算下 4 次朴素重采样就追平了整条流水线。小模型写对代码远比写对测试可靠。
- 作者已改做法:判定权交给规格或人写的示例,模型可以提议测试但不能当裁判。附带报告与 harness 开源。局限:仅 6 任务、360M–1.7B 小模型,大模型能好多少未知。
所属事件:实测揭示模型自写测试大量误杀正确代码(2 条相关)→
「编程与Agent」频道最新
- HuggingFace 用多 harness 强化学习解决模型换壳掉点问题 — huggingface · 2026-10-05
- Garry Tan:大厂 harness 有烧 token 动机,初创工具因此有真实价值 — garrytan · 2026-10-05
- 开发者自制彩色进度板,可视化 agent 长时运行全程 — kevinkern · 2026-10-05
- 开源安全模型 Security-One 发布:27B 权重,专为智能体安全决策设计 — huggingface · 2026-10-05
- 一小时提示词拼出 3D 游戏场景,展示 GPT Sol 6.1 能力上限 — aitrendz_xyz · 2026-10-05
- GPT-6.1 Sol 搭 Three.js:一周做出可在线试玩的完整游戏 — aitrendz_xyz · 2026-10-05