实测 Jev 模型 16379 次请求:非前沿但改写性价比曲线
enn_nafnlaus · reddit · 2026-10-04
Reddit 用户 ennnafnlaus 花两周对 TypeSafe AI 的 Jev 模型做了大规模独立实测,覆盖 16,379 条 benchmark 请求,测量延迟与计费,并探究其底层真身。
- 宣传口径称其为「ChatGPT 联合发明者打造、不会幻觉的前沿级推理模型,快且近乎免费」,实测结论更冷静:非前沿水平,但确实弯曲了性价比 Pareto 曲线
- 底层探测显示它不太可能是任何现有模型的换皮
- 报告记录了多种怪异行为,例如选项顺序强烈影响选择概率,值得使用者知晓
结论:虽然不达前沿,但在一个其他人没有很好覆盖的细分用途上确实实用。
「模型」频道最新
- Gemini 3.6/3.7 Flash 即将下线,Gemini 4 Argon 曝光在即 — leslysandra · 2026-10-04
- 用户自曝:因 Recidivism 连带封禁付费主账号且无法退款 — anakinimsorry · 2026-10-04
- 用户实测发现 ChatGPT 图像生成首次输出逼真裸露内容 — flowersslop · 2026-10-04
- BOSSFIGHT 基准:让模型经营咖啡店,GPT-6.1 拿 67 分却裁员举报者 — LordKittyPanther · 2026-10-04
- 为什么跟大模型聊天特别累?三点观察:啰唆、省宾语、怕重复 — oran_ge · 2026-10-04
- Yacine 自曝把不存在的 Opus 5.5 拽出分布外强逼思考 — yacineMTB · 2026-10-04