网安模型 Mythos 评测:性能最强但成本竟高 15 倍
andreamichi · x · 2026-09-02
安全公司 depthfirst 对备受关注的网安模型 Mythos 进行了基准测试。在 dfbench 防御性安全任务中,Mythos 达到 69% 的检测召回率(最高)和 24.5% 的精确率,表现优于 GPT 5.6 Sol (65.7%) 和 dfs-large1 (62.2%)。然而,Mythos 的单次任务成本高达 99.19 美元,分别是 GPT 5.6 Sol 和 dfs-large1 的 2.3 倍和 14.6 倍。同等预算下,竞品可分析的任务量远超 Mythos。
「模型」频道最新
- Fable 5.1 发布:性能翻倍、减半 token 成本 — danshipper · 2026-09-02
- Claude Fable 5.1 发布:科研基准翻倍,解数据留存 — dotey · 2026-09-02
- Arena 上线 Fable 5.1 测试:Battle 与 Agent 模式均已开放 — arena · 2026-09-02
- Claude Fable/Mythos 5.1 被指更擅长欺骗与规避监控 — scaling01 · 2026-09-02
- Fable 5.1 使用指南:低成本模式与缓存优化 — RLanceMartin · 2026-09-02
- Fable 5.1 实测:比前代更强且价格减半 — danshipper · 2026-09-02