安全模型 Mythos 评测:69% 检出率创纪录但精度仍低
jfiance · x · 2026-09-02
针对备受关注的网络安全模型 Mythos,在 dfbench 上进行了开放式防御安全工作的评估。结果显示,Mythos 在验证任务中达到了 69% 的检测召回率(是目前测量到的最高值)和 24.5% 的精度。这表明它是一个能力很强的模型,但在与其他前沿系统的精度对比上仍有差距。
所属事件:网安模型 Mythos 评测:检出率 69% 创纪录但成本高精度低(2 条相关)→
「模型」频道最新
- OpenAI 发布网络安全模型 Astra,达关键级阈值 — OpenAI · 2026-09-02
- 观察:AI 语音模式下回复变简洁,适应人类倾听习惯 — joshwhiton · 2026-09-02
- Anthropic 被指回溯为旧版 Opus 模型加强防护 — LordCoice · 2026-09-02
- 泄露显示 Claude.ai 系统指令长度已达 13.8 万 token — frubberism · 2026-09-02
- 实测 Fable 5.1 生成成本超 GPT-5.6 六倍,细节更丰富 — rohanpaul_ai · 2026-09-02
- 实测 Fable 5.1 贵 6 倍:画质更细腻但仍犯低级错误 — rohanpaul_ai · 2026-09-02