Mistral Large 4 网安基准反超 Opus 5.5 与 GPT-6,全因拒绝率更低
burny_tech · x · 2026-10-07
账号 @cline 转发:在网络安全类基准上,Mistral Large 4 跑赢了 Claude Opus 5.5 和 GPT-6 Astra,主要原因是它对安全任务拒绝得少得多——而 Opus 和 Astra 约有 40% 的任务被自身安全护栏拦截。这条对比揭示了安全护栏与实测成绩之间的张力:更严格的对齐在网安基准上反而拖累分数。Cline(知名编码 agent 团队)作为重度使用者,其观察对选型有实际参考价值。
「模型」频道最新
- Qwen3.8 Flash Next IQ3_S 量化版实测:基本无损且省内存 — lxfater · 2026-10-07
- 省 token 用 Haiku 跑简单任务翻车:开发者直言再不犯此错 — geoffwolfe · 2026-10-07
- Grok Bot 进步明显,但本地电脑操控仍短板,主打云端计算机 — mark_k · 2026-10-07
- 开发者实测 Grok bot 做 SEO 惊艳,但 Grok 4.5/4.7 不如 DeepSeek v4.1 — gaganghotra_ · 2026-10-07
- 马斯克宣布 SpaceX 版 Grok 将接入 Claude、MidJourney 等多家最优模型 — elonmusk · 2026-10-07
- OpenAI 在欧盟上线 textGrain 文本水印,用户无选择权 — Banania2020 · 2026-10-07