Kimi K3 在网络安全上很强,但 token 效率卡住了评测
teortaxesTex · x · 2026-07-27
- 这条转述了一段关于 Kimi K3 的网络安全能力讨论:有人认为它在 cyber 上可能已经到了 “mythos tier”。
- 但它推理效率不够高,因此在 UK AISIS 这种总 token 上限只有 1 亿的评测里可能都跑不出来。
- 线程里还提到,在 Noah Lebovic 自己的评测中,K3 的表现大致介于 Opus 4.8 和 5.6 Sonnet 之间。
- 整体观点是:当前无论开源还是闭源模型,在 cyber 场景里其实已经很强;真正的问题是评测设计和 token 预算,可能把能力“遮住”了。
「模型」频道最新
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27