实测 JEV 炒作:22M 参数本地模型 93% 击败 JEV 的 80%
Prompt Engineering · youtube · 2026-09-20
Prompt Engineering 频道发布视频,对被称作「全新模型类别」的 JEV 做炒作祛魅与基准实测:
- 历史脉络:单次前向分类器可追溯到 2018 年,零样本标签流水线 2019 年就有,JEV 并非全新概念。
- 基准对比:在 4 个任务上把 JEV 与 3 种成熟方案对比;一个 22M 参数的本地模型在 Banking77 上拿到 93%,JEV 只有 80%,且本地模型在 CPU 上 8 毫秒内完成、零成本。
- JEV 的真优势:动态指令跟随(dynamic instruction following)——这是老式分类器方案做不到的。
- 视频还讨论了「System One 模型」概念与混合架构的未来方向。
「模型」频道最新
- XGEN 发布生成式世界模拟系统:JING 模型登顶 WBench Full 榜 — hey_abusiddik · 2026-09-20
- 评测者称纯代码启发式策略可在 Craftax 上胜过大模型 — JoshPurtell · 2026-09-20
- OpenAI Codex 全员重置已生效,官方预告周二有大发布 — kimmonismus · 2026-09-20
- Jev 做 PR 审查比 GPT-5.6 Luna 快 1.93 倍,单次仅 $0.0014 — aniketmaurya · 2026-09-20
- 果蝇连接组国际象棋模型击败 Jev,Labonne 再战一个 — maximelabonne · 2026-09-20
- Bonsai 2 27B 安全护栏砍掉近 20 分,SWE-bench 与 Terminal-bench 成绩大缩水 — julianharris · 2026-09-20