Kimi K3 在网络安全上很强,但 token 效率卡住了评测
teortaxesTex · x · 2026-07-27
- 这条转述了一段关于 Kimi K3 的网络安全能力讨论:有人认为它在 cyber 上可能已经到了 “mythos tier”。
- 但它推理效率不够高,因此在 UK AISIS 这种总 token 上限只有 1 亿的评测里可能都跑不出来。
- 线程里还提到,在 Noah Lebovic 自己的评测中,K3 的表现大致介于 Opus 4.8 和 5.6 Sonnet 之间。
- 整体观点是:当前无论开源还是闭源模型,在 cyber 场景里其实已经很强;真正的问题是评测设计和 token 预算,可能把能力“遮住”了。
所属事件:Kimi K3 网络安全能力突出但受限于 token 效率(2 条相关)→
「模型」频道最新
- 决策模型 Jev 接入 OM1,在 NVIDIA Isaac Sim 中驱动 Go2 机器人导航 — paigeinsf · 2026-09-23
- Cline 宣称 MiMo-v2.6-Pro 登顶开源权重模型榜 — burny_tech · 2026-09-23
- Anthropic 自嘲式官宣:Opus 5.5 远胜 Opus 5,网友戏称该向旧模型道歉 — repligate · 2026-09-23
- Opus 5.5 创作实测:「建议你把想要的都画出来」 — repligate · 2026-09-23
- Ofir Press 解释第三方跑分更高:任务子集与计分口径不同 — OfirPress · 2026-09-23
- 早期用户实测 Opus 5.5:好到误以为是新品 Fable — EricBuess · 2026-09-23