网络攻防基准 BlueBench:GPT-5.6 登顶,Kimi 领跑开源
vijaybolina · x · 2026-08-16
BlueBench-Intrusion-003 基准测试发布,利用真实 AWS 环境入侵数据评估模型网络事件响应能力。模型需根据安全警报调查 CloudTrail、GuardDuty 等日志并生成报告。
关键结果:
- GPT-5.6 Sol 以 88.3% 领跑,GPT 系列主导帕累托前沿。
- Kimi K3 在开源权重模型中表现最佳(85.1%)。
- 仅 Anthropic 受服务级网络安全拒绝策略影响。
「模型」频道最新
- Looped Transformers 成研究新热,Kye Gomez 称早被自己押中 — KyeGomezB · 2026-10-02
- 每月 400 美元买哪个 Agent?网友提议让它们同城对抗实测 — nick_linck · 2026-10-02
- fastino 发布 GLiDE:首个按需思考的决策模型,Decision Index 登顶 — kalyan_kpl · 2026-10-02
- Anthropic 自述:从 Sonnet 5 的「难聊」到 Fable 5.1 找回经典 Claude 手感 — every · 2026-10-02
- 1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼 — michellechen · 2026-10-02
- 两张 96GB 昇腾卡本地跑 Qwen:从 1 tok/s 调到 30 tok/s 全记录 — matteiuspi · 2026-10-02