Kimi K3 网络评测仍偏弱,但已能跑完整长链路
dyn___ · x · 2026-07-24
这条内容是在讨论 Kimi K3 的网络安全能力评测,配图里还给出了与多款中美模型的对比图表。
- 评论者认为,把分数直接叫作“cyber capability”有点夸张,因为底层基本是 ExploitBench。
- 但他也承认,Kimi K3 在 1/10 的完整 TLO solve 上仍然有意义:可靠性不高,但说明在这个设定下,模型已经能跑完整条长链路。
- 他强调,榜单排名不等于真实世界能力;如果换成更好的脚手架和专家指导,实际表现可能会完全不同。
- 附图展示了 Kimi K3、GLM-5.2 等模型与顶级美国模型在 cyber capability 和 ladder score 上的差距。
所属事件:Kimi K3 网络安全评测出炉:长链路能力提升但整体偏弱(2 条相关)→
「模型」频道最新
- 两段提示词复刻谷歌3D地球,开发者实测 Kimi K3 — DuRuofei · 2026-07-24
- Kimi 演示称 1.5 小时重建了 Google Maps 3D 体验 — shakoistsLog · 2026-07-24
- Kimi K3 被爆周一开放权重,速度提升三倍 — bindureddy · 2026-07-24
- Composite-Bench 发布可验证电脑使用评测,GLM-5.2 领先 Kimi K3 32 分 — davidtsong · 2026-07-24
- 用户称 GPT-5.6 有问题,建议 Pro 订阅者先回退 5.5 — andersonbcdefg · 2026-07-24
- Sakana AI 推出 Fugu-Ultra v1.1,基准最高提升 7.9 分 — SakanaAILabs · 2026-07-24