网络攻防基准 BlueBench:GPT-5.6 登顶,Kimi 领跑开源
vijaybolina · x · 2026-08-16
BlueBench-Intrusion-003 基准测试发布,利用真实 AWS 环境入侵数据评估模型网络事件响应能力。模型需根据安全警报调查 CloudTrail、GuardDuty 等日志并生成报告。
关键结果:
- GPT-5.6 Sol 以 88.3% 领跑,GPT 系列主导帕累托前沿。
- Kimi K3 在开源权重模型中表现最佳(85.1%)。
- 仅 Anthropic 受服务级网络安全拒绝策略影响。
「模型」频道最新
- llama.cpp 集成 Dots3 Note 模型,SWE-bench Verified 得分 78.4 — victormustar · 2026-08-16
- GLM-5.3 后训练展现惊人能力,参数量并非智力瓶颈 — haider1 · 2026-08-16
- 代码提交显示 Qwen 35B 模型已被移除或不会发布 — Local-Cardiologist-5 · 2026-08-16
- 多模型动漫女孩场景生成盲测结果 — Jeanodel · 2026-08-16
- 1bit量化让Qwen 27B在12GB显存跑出92 tokens/s — zyxciss · 2026-08-16
- Anthropic 公开 Claude 官方系统提示词 — tosh · 2026-08-16