第三方实测 Mercury Decide:韩国语数据集上准确率仅 66.7%

FlexDruk · reddit · 2026-10-01

一位开发者用自建的、无污染的韩语数据集(ReportJevBench)对 Inception Labs 新发布的 Mercury Decide 做了基准测试,专注判定 Roblox 聊天举报是否违反 ToS 的真实场景。结果:Jev 准确率 83.3% 居首,Kev 72.2%,Mercury Decide 仅 66.7%,Solar Decide 57.8%。更关键的是漏判(false negative):在 0.5 阈值下 Mercury Decide 对 90 例漏判 28 例,而 Jev 仅漏 3 例;调整阈值后 Mercury Decide 表现依然别扭,几乎倾向对所有举报说「不」,比 Kev 还差。作者结论:目前没有任何 API 决策模型比 Jev 更稳定。局限是该基准高度聚焦韩语理解与 Roblox ToS 这一特定任务。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →