实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线
This_Cell_1829 · reddit · 2026-09-20
Reddit 用户 ThisCell1829 用 Jev 对 NASA 开普勒兴趣目标(KOI)目录做了回溯分类测试:8054 条历史信号,每条给 21 个测量值,要求判定为确认行星、假阳性或候选,先保存全部预测再对照 NASA Exoplanet Archive 标签。
结果:Jev 总准确率 54.2%,低于简单的 3 规则基线(64.4%)和「全猜假阳性」(49.0%)只高一点。Jev 擅长抓假阳性,89.6% 判对;但对确认行星极为保守——2731 颗确认行星中只标了 8 次「确认行星」,且 8 次全对,其余 2723 颗几乎都被判为候选。整体更像一个谨慎的假阳性过滤器而非通用分类器。
其他数据:8054 次调用零失败,中位延迟 338ms,总成本约 0.36 美元。作者还用真实开普勒视场做了可视化。
「模型」频道最新
- OpenAI 将为 Codex 和 ChatGPT Work 用户引入用量重置机制 — gaganghotra_ · 2026-09-20
- JevBench 榜单出炉:Jev 仍居榜首但优势缩小 — airesearch12 · 2026-09-20
- Grok Voice Transcribe 2.0 发布:短句 WER 从 20.6% 降至 6.8% — nima_owji · 2026-09-20
- FT 调查:AI 聊天机器人回答金融问题多数时候是错的 — SatelliteNetSec · 2026-09-20
- 实测 Jev:数字母都只给概率,显然的问题也会答错 — eptwts · 2026-09-20
- 刺小人形任务测试:Fable 20次全拒,Astra 85%照做 — AaronBergman18 · 2026-09-20