第三方实测 Meta Muse Spark 1.3:安全基准 19/32,仍不敌中国前沿模型
teortaxesTex · x · 2026-09-03
Meta 发布 Muse Spark 13(扎克伯格称编码与 agent 能力是史上最大跃升),第三方在其网络安全基准上的实测泼了冷水:
- pass@1:平均发现 19/32 个 CVE,低于 Grok 4.6 的 23.3/32
- pass@3(3 次取池):24/32,仍落后 DeepSeek V4 Pro 的 28/32
- 价格:比多数前沿模型便宜,但与一些中国模型相比性价比难以成立
- 缓存命中率仅 45%(通常更高),作者按 90% 假设折算了结果
结论:Meta 在缓慢追赶,模型编码尚可,但在网络安全任务上明显不到位;官方还预告 Muse Spark 开源权重和「🍉」即将发布。
「模型」频道最新
- 博主对比发现海外模型订阅均价远低于国内 token 套餐 — yihui_indie · 2026-09-03
- 实测排名:Fable 5.1超Claude Opus,RL环境生成最强 — HarveenChadha · 2026-09-03
- 哲学家称 Fable 5.1 找出 Arrhenius 不可能性定理并不成立 — willmacaskill · 2026-09-03
- Reddit 用户称 OpenAI 大规模封号:付了费却被禁用服务 — Existing-Slide7395 · 2026-09-03
- 实测 Gemini 语音转写模型出色,作者开源 Windows 听写工具 AivoRelay — lvvy · 2026-09-03
- Meta 新模型 Muse 突吐中文字符,网友猜蒸馏自中国模型 — zsakib_ · 2026-09-03