Kimi K3 以 19.37 美元找出 86 个漏洞中的 32 个
zeeg · x · 2026-07-23
Kimi K3 在 Warden 评测里打出高性价比
帖子称,Kimi K3 在 Warden 的基准测试里表现很稳,全程没有失败,也没有触发修复任务,这一点在同类测试里并不常见。
配图给出了一组漏洞发现与成本对比:
- Kimi K3:发现 32/86 个已知漏洞,命中率 37.2%,总成本 19.37 美元
- Claude Sonnet 5:22/86,25.6%,23.46 美元
- Grok:33/86,38.4%,38.65 美元
- Luna:36/86,41.9%,56.98 美元
作者的结论是:Kimi 的“准确率/价格比”非常夸张,准备直接切换使用。
「模型」频道最新
- Claude Opus 5 传闻、OpenAI Codex 语音 agent 与 Cerebras 750 tok/s — imjustnewatai · 2026-07-23
- BrowseComp 图表显示 Kimi K3 高分低成本,排在左上角 — iamfakhrealam · 2026-07-23
- Grok Build 据称在浏览器任务上胜过 Codex 和 Claude Code — elonmusk · 2026-07-23
- Reddit 讨论:Hunyuan Image 3.0 Instruct 值不值 170GB 显存 — dtdisapointingresult · 2026-07-23
- 实测GPT/Claude/Gemini/Kimi真实任务成本:价差2倍但实际成本差10.6倍 — pixelo2323 · 2026-07-23
- 马斯克称 Grok 4.5 在 8 分钟内推翻 30 年图论猜想 — kevinnbass · 2026-07-23