Mistral Large 4 网安基准反超 Opus 5.5 与 GPT-6,全因拒绝率更低

burny_tech · x · 2026-10-07

账号 @cline 转发:在网络安全类基准上,Mistral Large 4 跑赢了 Claude Opus 5.5 和 GPT-6 Astra,主要原因是它对安全任务拒绝得少得多——而 Opus 和 Astra 约有 40% 的任务被自身安全护栏拦截。这条对比揭示了安全护栏与实测成绩之间的张力:更严格的对齐在网安基准上反而拖累分数。Cline(知名编码 agent 团队)作为重度使用者,其观察对选型有实际参考价值。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →