CyberGym 成绩超 85-86% 的模型大概率都是过拟合
terryyuezhuo · x · 2026-09-15
一条针对模型评测可信度的提醒:如果看到任何模型在 CyberGym(定向崩溃/crash 任务)基准上拿到 85-86% 以上的分数,基本可以认定其结果过拟合。对关注安全类 eval 榜单、用分数选模型的人有直接参考价值。
「模型」频道最新
- RewardAI 发布 OM-1:机器人模型零样本跨本体泛化 — zipengfu · 2026-09-15
- 外科智能榜单更新:20余款通用 VLM 全面落后专科模型 — ddonoho · 2026-09-15
- 外科基准不像数学基准:微调小模型为何能登顶专科任务 — ddonoho · 2026-09-15
- Claude Opus 5.2 疑似灰度测试,跳过 5.1 直接上线 Claude Code — Angaisb_ · 2026-09-15
- 新 Siri 今日上线,圈内反应冷淡:还有人在乎吗? — thederbiedone · 2026-09-15
- Qwen 27B 本地跑 90% 幻觉,开发者吐槽领域知识缺失 — JustinPooDough · 2026-09-15