开发者实测:Jev 幻觉率与其他模型相当,官方宣传存疑
JeremyNguyenPhD · x · 2026-09-22
- 开发者 @danman314 指出,尽管 Jev 的开发方在宣传中刻意谨慎地声称其「不会幻觉」,但实测显示 Jev 的幻觉率与其他模型非常接近。
- 他贴出了一批具体幻觉案例,包括经典的「strawberry 里有几个 r」这类简单计数错误。
- 转发者 Jeremy Nguyen PhD 补充:这取决于你如何定义「幻觉」,但按通常标准,Jev 确实会幻觉。
所属事件:实测推翻宣传:Jev 模型幻觉率与其他模型相当(2 条相关)→
「模型」频道最新
- Kev 重构至 Qwen3.5,开源小决策模型更新 0.8B/4B/9B 三档 — alexcovo_eth · 2026-09-22
- 开源决策模型 Laya 移植 Core ML,99.5% 算子跑上 ANE,单次决策 3.7ms — alexcovo_eth · 2026-09-22
- Fireworks 实测:按任务路由 18 个模型,解决率 97.6% 且成本仅 1/3 — sophiamyang · 2026-09-22
- Grok 4.7 发布后评测舆论两极,无人晒真实使用体验 — ns123abc · 2026-09-22
- Grok 4.7 Fast 被曝同模型双倍计价,仅限 Cursor 等渠道 — Daniel_Farinax · 2026-09-22
- async 4 罕见公开训练数据配比,评论者称 30 步全跑完表现意外 — stochasticchasm · 2026-09-22