第三方实测 Mercury Decide:韩国语数据集上准确率仅 66.7%
FlexDruk · reddit · 2026-10-01
一位开发者用自建的、无污染的韩语数据集(ReportJevBench)对 Inception Labs 新发布的 Mercury Decide 做了基准测试,专注判定 Roblox 聊天举报是否违反 ToS 的真实场景。结果:Jev 准确率 83.3% 居首,Kev 72.2%,Mercury Decide 仅 66.7%,Solar Decide 57.8%。更关键的是漏判(false negative):在 0.5 阈值下 Mercury Decide 对 90 例漏判 28 例,而 Jev 仅漏 3 例;调整阈值后 Mercury Decide 表现依然别扭,几乎倾向对所有举报说「不」,比 Kev 还差。作者结论:目前没有任何 API 决策模型比 Jev 更稳定。局限是该基准高度聚焦韩语理解与 Roblox ToS 这一特定任务。
「模型」频道最新
- RLHF 论文合著者 Diogo Almeida 分享 TypeSafe Jev 模型背后的理念 — AxSaucedo · 2026-10-01
- 用户吐槽 GPT-6 Sol 编码更慢更笨,Codex 体验倒退 — burkov · 2026-10-01
- 用 GPT-6.1 Sol 算出地球到火星仅需三天转移轨道 — MikePFrank · 2026-10-01
- Codex Pro 用户疑遭积分暗扣:62,500 额度凭空少 122 — Constant-Potential-9 · 2026-10-01
- Qwen Flash Next MTP 工作重启,官方 GGUF 量化与 llama.cpp PR 上线 — jacek2023 · 2026-10-01
- DeepSeek 推出 200 美元 Pro 编程订阅:无任何限速,用完额度为止 — teortaxesTex · 2026-10-01