4B 模型验证器模式测试报告

retarded_770 · reddit · 2026-08-21

作者进行了为期一个月的实验,测试在 4B 模型上使用“代码验证,模型生成”的 Harness 模式能否替代大模型规模。该方法将推理拆分,每一步调用模型后由代码验证事实(数字需逐字匹配、词汇覆盖率≥60%),仅传递验证过的事实给下一阶段。

结果:

核心问题: 跨阶段不一致性。模型在阶段 2 正确识别约束,却在阶段 4 的行动中违反。即使推理微调的模型也仅能部分缓解此问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →