实测 Jev 对比 7 个前沿模型:快 3-6 倍、成本仅 1/100,但都不懂用户偏好
PrimaryMagician · reddit · 2026-09-21
作者用「清理 110 个积压 YouTube 订阅」这一真实主观任务,对比 TypeSafe 的「决策模型」Jev 与 Opus 5、Sonnet 5、Haiku 4.5 及经 Codex 的 Sol/Astra/Terra/Luna。
速度与成本
- Jev 9.1 秒跑完 110 个频道;其余经 CLI 需 3-7 分钟;独立直连测试 Jev 快 3-6 倍
- 成本:Jev 约 $0.004,其余 $0.03-1.11
- 与 Opus 5 的排序一致性 0.88-0.97;两次运行间分数波动比 Sonnet 5 小 3-4 倍
关键发现:都不懂用户
- 作者人工标注 66 个频道的去留,所有模型(含 Jev)AUC 仅 0.43-0.52,接近抛硬币
- 而「近六周是否看过」这一简单统计达 0.69
- 模型彼此高度一致,却都猜不中用户真实偏好;作者自己盲测重标时也有 3/13 不一致,说明 ground truth 本身噪声很大
作者随后构建了刻意朴素的方案:模型打分 + 阈值/上限规则 + 人工通过 YouTube API 逐一批准,Python + SQLite,MIT 开源(github.com/abhibansal60/tidy)。
「创投」频道最新
- Vals 用真实工作场景做私有评测,营收涨 8 倍 — TansuYegen · 2026-09-21
- Jeff Dean:RL+新 EDA 工具有望把芯片设计从 2 年压缩到 3 个月 — ycombinator · 2026-09-21
- 两年经验 ML 工程师拒 40 万美元 offer,AI 人才市场持续疯狂 — ingliguori · 2026-09-21
- 开发者晒 AI 原生游戏平台 Spawn 真实留存数据 — majidmanzarpour · 2026-09-21
- 不支持 Agent 支付的商家,转化率可能直接归零 — jeff_weinstein · 2026-09-21
- Anacondahood 上线:conda 研究 + Robinhood MCP 执行 + 链上三轨交易生态 — teoliphant · 2026-09-20