实测:零训练 Qwen 横扫专门训练的决策模型 35 分
KingPinX · reddit · 2026-09-23
reddit 上冒出多个「typed decision model」项目,楼主没信 README 的分数,而是用自己私有仓库(Discord RPG bot)的 git 历史、从 conventional commit 前缀免费拿到标注,实测对比三个模型加一个免费基线。
结果(标注来自去掉 type(scope): 前缀的提交,不给模型答案钥匙):
| 任务 | Jev(托管付费) | SemIf(CPU) | Von 1.0 | 免费基线 |
|---|---|---|---|---|
| 提交类型 6 选 1(n=90) | 78.9% | 62.2% | 26.7% | 31.1% 正则 |
| 文件路由 12 选 1(n=80) | 81.3% | 63.8% | 8.8% | 48.8% 关键词 |
| 是否 feature(AUC) | 0.944 | 0.899 | 0.513 | 0.543 关键词 |
关键发现:
- SemIf(MIT)完全不训练:加载现成的 Qwen3.5-4B,把状态和选项描述塞进一个 prompt,单次前向读选项 logits。这个「零训练」方案在提交类型上碾压专门训练的 Von 35 分、路由上碾压 55 分——Von 路由 8.8% 甚至输给关键词匹配(48.8%),而瞎猜都有 8.3%。
- Von 的缺陷被解剖:90 个提交里 69 个被判为 refactor,喂一个句号或十个随机数字照样输出 refactor;feature 概率的符号还是反的(真 feature 概率反而更低)。
- 置信门限不可迁移:SemIf 的 0.85 门限让路由提 22 分,提交类型只提 4.5;同一门限放到 Von 上,保留 30% 样本且全错——「选择性地自信地错」。门限必须按任务、按模型单独调。
- 成本:CPU 上最长任务每决策 30.9 秒(p95 41s),延迟跟状态长度而非选项数走。SemIf 硬编码 ngpulayers=0,所有数字都是 CPU 跑的。
作者强调:仓库私有无法复现数字,但方法可复现——用 conventional commits 的标注 + 一个下午就能搭起来。n=80180,10 分以内的差距当噪声看。下一步计划测 Laya 等其他项目。
「编程与Agent」频道最新
- Geoffrey Huntley:AI 是时间压缩机,用来探索想法空间而非堆功能 — kieranklaassen · 2026-09-23
- 团队用 Typesafe Jev 在工单创建时自动追问缺失信息 — TheMoonMidas · 2026-09-23
- 评测第一步是发现错误:跳过它就会衡量错误的问题 — FinanceYF5 · 2026-09-23
- AI 产品易改难测:Evals 把「好」变成可重复的上线检查 — FinanceYF5 · 2026-09-23
- MCP 是个坏主意吗?视频引发智能体协议反思 — RelevantEmergency707 · 2026-09-23
- 开发者演示:输入文字即变成对应 UI 的魔法文本框 — BLUECOW009 · 2026-09-23