JevBench 冲上 HN 首页,质疑者指 Jev 疑似套壳 Qwen
airesearch12 · x · 2026-09-23
JevBench——一个针对「typed decision models」的可复现基准——登上 Hacker News 首页(103 分、25 条评论),随即引发质疑。
- 基准设计:Jev 类模型返回有界选择和概率而非文本,比 LLM 更快更便宜;JevBench 用加权方式同时衡量准确率、延迟和价格,v1.3 综合了 chance-corrected 智力、校准、速度与成本,完整运行含 534 个英文决策题。
- 当前榜单:Jev 74.4 分第一,SemIf 73.1、djev 73.0、Winnow-12B Q8 71.2、reflex 4B 70.3。
- 开源与透明:MIT 协议 harness、公开题目、冻结产物、评分代码公开,并提供两个免注册 demo。
- HN 热评质疑:有人指出 Jev 获 4000 万美元融资、隐身两年,但表现与几天内搭建、直接用 Qwen 无微调、可跑在浏览器里的 SemIf 相当,价格还是两倍,且 Jev 的回答总认为自己是 Qwen——评论者怀疑这是「微调 Qwen 包装成大项目」的骗局。
- 已披露局限:仅英文、延迟来自单台德国服务器、本地/演示延迟有 ×2 调整(+150ms)、1 分左右的差距可能是噪音。
「Fun」频道最新
- Jev 发布不到一周涌现一堆开源平替,有人做站专门横评 — airesearch12 · 2026-09-23
- Claude Opus 一次生成太阳系像素动画,还配准了霍尔斯特《行星组曲》 — technollama · 2026-09-23
- 一周冒出 Jev、GPT sol 6 等一串新模型名,网友已分不清谁是谁 — malliktwts · 2026-09-23
- AI 圈争论:给穷学生堆 B300 也拼不过从小黑客,印度 JEE 摧毁技术人才 — itsOmSarraf_ · 2026-09-23
- 大模型发布间隔从 73 天缩至 18 天加速肉眼可见 — MickeySteamboat · 2026-09-23
- \paragraph{} 成 AI 实验室生成文本的「阑尾」,学界味AI文风标志 — aryaman2020 · 2026-09-23