Arize 实测:Jev 幻觉检测比肩 Opus 5,快 23 倍、成本仅 1/300
aparnadhinak · x · 2026-09-24
Arize AI 基于 23,325 条人工判断,对 Jev、Claude Opus 5 和 GPT-5.6 Terra 在准确率、成本、延迟和校准上做了对比。结果显示,Jev 在幻觉检测上达到 87% 的准确率,与 Claude Opus 5 相当,但速度快 23 倍,成本约为其 1/300。
这一基准针对的是「LLM-as-a-Judge」场景,提示小型专用决策模型在评测/审核类任务上可能以极低成本逼近前沿大模型水平。
「模型」频道最新
- Claude Opus 5.5 一次提示词写出生成 90 年代风格 demoscene 演示 — PurzBeats · 2026-09-24
- 曝 OpenAI 效率布局:GPT-6 Luna 主打性价比,Sol 低价保留多数智能 — haider1 · 2026-09-24
- 网传「Claude Opus 5.5 对 ChatGPT 6 Astra」对比视频,模型名存疑 — balianone · 2026-09-24
- 拍 4 张白板照片,Astra 一次完成识别、OCR 并矢量化 — iskander · 2026-09-24
- 用户实感:Claude 额度机制生变,本周主要被 Opus 限额卡住 — rudrank · 2026-09-24
- 用户质疑 OpenAI 用 Sol 换皮 Terra 降价却砍用量额度 — RexDouglass · 2026-09-24