真实举报数据打脸:Solar Decide 自定义基准仅57.8%,远逊 Jev 的83.3%
FlexDruk · reddit · 2026-09-29
韩国 Upstage 基于 Solar Mini 4 发布了 Solar Decide,作者在自家 Roblox 游戏的 AI 聊天举报处理系统(玩家以韩国人为主)中实测后回滚:
- 通用基准 JevBench 上 Solar Decide 得 88.9%,Jev 为 98.6%;
- 作者用 352 条真实举报中的 90 条人工标注,让 agent 生成自定义基准 ReportJevBench,结果 Solar Decide 仅 57.8%,Jev 为 83.3%;
- 关键差距在误报:90 条里 Jev 误报 11 条,Solar Decide 误报 37 条,大量误报会浪费 token 并使系统失去意义;实际使用第一天 Solar Decide 就把假举报判为有效。
数据集和结果已开源在 GitHub(韩文,需翻译)。
「模型」频道最新
- 曝 OpenAI「dot」设备新细节:举到耳边即可对话 ChatGPT 语音 — koltregaskes · 2026-09-29
- Google 将于 11 月 17 日用 Skills 取代 Gemini Gems — mark_k · 2026-09-29
- 开源工具 Carla:本地跑 llama.cpp 造「AI 角色」的织机实验室 — max_paperclips · 2026-09-29
- 爆料称 OpenAI DevDay 新品是 Grok 机器人与 Meta Muse 的翻版 — gaganghotra_ · 2026-09-29
- 高帧率运行让 Jev 成为真正的 System 1:每次点击都传完整状态 — mathemagic1an · 2026-09-29
- 爆料称 OpenAI 新模型命名候选流出:Dots、Orbit、o — mark_k · 2026-09-29