4B 模型验证器模式测试报告
retarded_770 · reddit · 2026-08-21
作者进行了为期一个月的实验,测试在 4B 模型上使用“代码验证,模型生成”的 Harness 模式能否替代大模型规模。该方法将推理拆分,每一步调用模型后由代码验证事实(数字需逐字匹配、词汇覆盖率≥60%),仅传递验证过的事实给下一阶段。
结果:
- 同权重对比: Harness 模式达到 6/16 的“认证清洁”准确率,而单次直出为 0/16 (p≈0.008)。
- 第三方 Holdout: Harness 得分 5/16,而推理版 Qwen3-4B-Thinking 得分 2/16,单次直出 1/16(Token 耗费相近)。
- 失败之处: 严格标准的实验结果未在 Holdout 集上复现(0/16),属于过拟合。
核心问题: 跨阶段不一致性。模型在阶段 2 正确识别约束,却在阶段 4 的行动中违反。即使推理微调的模型也仅能部分缓解此问题。
「研究」频道最新
- DeepMind:从Atari到EVE Online,15年游戏AI研究新篇章 — Google DeepMind · 2026-08-21
- EMNLP 收录:Instruction Hierarchy 解决 Agent 指令冲突 — DanielKhashabi · 2026-08-21
- 新指标 Harmony 揭露平均分掩盖模型性能不均 — DanielKhashabi · 2026-08-21
- MTEB 贡献者发 51 个 PR 统一多模态建模 — tomaarsen · 2026-08-21
- AI 智能体可参与训练基础模型以攻克癌症 — iScienceLuvr · 2026-08-21
- The Forecasting Company 开源 t0-alpha,详解预测模型五阶段演进史 — fpedregosa · 2026-08-21