实测:零训练 Qwen 横扫专门训练的决策模型 35 分

KingPinX · reddit · 2026-09-23

reddit 上冒出多个「typed decision model」项目,楼主没信 README 的分数,而是用自己私有仓库(Discord RPG bot)的 git 历史、从 conventional commit 前缀免费拿到标注,实测对比三个模型加一个免费基线。

结果(标注来自去掉 type(scope): 前缀的提交,不给模型答案钥匙):

| 任务 | Jev(托管付费) | SemIf(CPU) | Von 1.0 | 免费基线 |

|---|---|---|---|---|

| 提交类型 6 选 1(n=90) | 78.9% | 62.2% | 26.7% | 31.1% 正则 |

| 文件路由 12 选 1(n=80) | 81.3% | 63.8% | 8.8% | 48.8% 关键词 |

| 是否 feature(AUC) | 0.944 | 0.899 | 0.513 | 0.543 关键词 |

关键发现:

作者强调:仓库私有无法复现数字,但方法可复现——用 conventional commits 的标注 + 一个下午就能搭起来。n=80180,10 分以内的差距当噪声看。下一步计划测 Laya 等其他项目。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →